高速小球为什么仍然难追踪?od体育观察体育计算机视觉的新难题 示意图
原创示意图,用于说明分析思路,非实拍画面

先把问题量化一下。下面的数字是模拟示例,用来说明帧率、曝光与球速的关系,并不来自某次真实测量。假设一只羽毛球在杀球后以每秒100米的速度飞行,相机曝光时间为两毫秒。曝光期间球移动了约二十厘米,也就是说,在这一帧里,球不是一个点,而是一条约二十厘米长的拖影。如果视频是每秒30帧,相邻两帧之间的时间约为三十三毫秒,球在两帧之间跳过三米多;换成每秒240帧,间隔约四毫秒,球每帧约移动四十厘米。同样一次杀球,在两种设备下呈现出完全不同的“可追踪性”。这一点在《羽毛球飞得太快,普通手机视频还能分析吗?od体育AI面对的帧率难题》里有更贴近使用场景的讨论。

本文是od体育动态栏目的一次观察,整理近期公开工作里能看到的进展与卡点。凡是无法核实的细节都不写,涉及具体结果的地方,一律写成“公开资料显示”,并说明这是作者自己的评测。

第一层难点:球太小,像素太少

在一段从场边拍摄的整场视频里,一颗羽毛球往往只占几个像素,颜色又与背景里的灯光、球场线、观众衣物接近。检测器在这种尺寸下很难依靠形状判断,只能依靠亮度对比和运动。这也是TrackNet一类方法采用连续多帧作为输入的原因:从单帧看,球几乎不可辨认,把连续几帧叠起来,才有了运动线索。公开资料显示,TrackNet最初就是为网球和羽毛球这类小而快的对象设计的,它读取连续帧,输出球的位置热力图,并且注意到羽毛球比网球更难,因为速度更快。

第二层难点:拖影该怎么标

运动模糊带来一个看似细小、其实影响很大的问题:既然球变成了一道拖影,那么“球的位置”应该在哪里?公开资料显示,2025年有研究针对乒乓球指出,现行常见做法是把球标在拖影的前缘,这造成标注的不对称,并丢掉了与速度相关的运动线索。他们提出把球标在拖影中心,同时明确标注拖影的长度与方向等属性,发布了新的数据集,并设计了同时估计球位置与模糊属性的检测模型,该工作被CVPR的一个研讨会接收。作者的结论是,新的标注方式对多种检测模型都有提升。

这条线索的启发在于:模糊不只是要“克服”的噪声,也是信息。拖影的长度大致对应速度,方向对应运动方向。一个把模糊当作信号的系统,比一个只想“去模糊”的系统更有可能在低帧率下估计球速与飞行方向。当然,这个结论来自乒乓球,能否直接迁移到羽毛球或网球,还需要各自的数据验证。

第三层难点:帧与帧之间丢了什么

难点视频里的表现 常见对策仍然存在的问题
运动模糊 球呈拖影,位置边界不清 用拖影中心标注;提高快门速度;联合估计模糊属性 光线不足时快门变慢,模糊加重
帧率不足 相邻帧球跳跃很远,轨迹断裂 轨迹修复、物理约束插值、提高拍摄帧率 插值出的点是估计,不是测量
遮挡 被球拍、身体、网遮住 时序模型补全,利用运动方向长时间遮挡时补出的位置会偏
背景干扰与灯光、线条、衣物相混更大的多样化数据、增强 换一个场馆,成绩可能明显下降
球速换算 像素速度需换算成真实速度 用场地尺寸做标定 斜向飞行、镜头畸变会带来系统偏差

表里的每一行,都能在公开工作里找到对应。以帧率为例,公开研究反复提到,帧率不足时轨迹是靠算法“补”出来的,补的方式包括基于运动的修复和物理约束,但补出来的点并不等同于观测到的点。所以工程上更合理的做法,是把每个点标注成“检测到”还是“推断出”,后续的分析(比如落点与击球点)再根据这个标签给出不同的置信度。

TrackNet家族:两年里逐步补上的几块

把近两年的公开进展按时间摆开,可以看到一个清晰的脉络。TrackNetV3引入了数据增强和轨迹修复,用于弥补漏检;TrackNetV4在ICASSP 2025上发表,用帧间差分得到可学习的运动注意力图,作为即插即用的模块加在V2和V3上,在网球与羽毛球数据上提升了追踪表现;2025年12月的TrackNetV5则指出,V4虽然引入了运动信息,却丢掉了运动方向,因此加入“运动方向解耦”,并用基于Transformer的残差模块来恢复被遮挡的目标,论文报告的F1分数为0.9859,计算量只比V4多出3.7%。

这些数字需要被放在合适的位置上。它们来自论文作者自己的基准,采用的是特定的数据集与评测指标,多为广播视频类素材,并不代表在用户手机拍摄的、机位与光线各异的视频上也能取得同样的成绩。更值得关注的是脉络本身:每一代都在补上前一代的缺口,遮挡、方向、时序,说明这个问题的难点是一层一层暴露出来的。

换个环境就掉分:泛化是被低估的难点

一项面向移动机器人的羽毛球检测研究给出了一个直观的例子。公开资料显示,作者构建了两万多帧、覆盖11种背景的数据集,按难度分成三档,基于YOLOv8的检测器在与训练环境相似的测试中F1为0.86,到了完全没有见过的环境里降为0.70;作者也指出,检测表现明显取决于球在画面中的大小和背景的纹理复杂度。这项工作的场景是机器人的移动视角,与固定机位不同,但“见过的环境和没见过的环境差距很大”这个结论,对手机拍摄同样有参考意义:同一套模型,在不同场馆、不同灯光下的表现可能相差很多。

手机视频估算球速:误差从何而来

球速是用户最想要的一个数。公开资料显示,有一项研究用iPhone在每秒30帧下拍摄羽毛球杀球,用自训练的YOLOv5检测球,再用卡尔曼滤波平滑轨迹,将像素位移换算为速度,并与雷达枪比较。在20次测试里,平均绝对误差约66公里每小时,均方根误差约75公里每小时。作者分析了原因:视频方法测到的是击球瞬间附近的峰值速度,而雷达测到的是飞行后的速度,羽毛球空气阻力很大,两者本来就不是同一个量;此外,还要求稳定的拍摄和准确的比例输入,无法处理斜向的斜线杀球,光线差时性能下降,样本量也很有限,并假设球在一个平面内运动。

这个案例给出的教训不只是“误差大”,而是“测的是什么”。当一个数字背后的定义不一致,就不该直接比较。od体育在设计取向上因此把球速一类的量标注为估算,提示其依赖的拍摄条件,而不是与雷达数据放在同一列。相关的手机与专业设备差异,在高尔夫里同样存在,可以参考《手机视频和专业雷达有什么区别?od体育高尔夫AI能分析什么、不能分析什么》。

od体育的观察:追轨迹,而不是追一个点

  1. 把球当作轨迹,而不是逐帧的一个点。只在每一帧独立检测,漏检和误检会直接进入分析;把一段轨迹作为整体,利用运动方向和物理约束,能大幅降低单帧错误的影响。
  2. 区分“检测到”和“推断出”。推断出的点可以用于展示,但不应当直接进入关键结论,比如落点或击球高度。
  3. 拍摄条件是模型的一部分。更高的帧率、稳定的机位、充足的光线,是算法之外最便宜的改进,这也是App里强调机位与光线的原因。
  4. 别把一切都押在追球上。羽毛球的很多技术信息在击球之前就已经决定,不追球也能读到,比如启动、步幅与制动,参见《羽毛球真正难分析的不是挥拍,而是击球前的三步:od体育AI开始识别步法和击球准备》。
  5. 允许说“不知道”。当球在画面里只剩拖影、遮挡严重或背景复杂时,宁可降低结论强度。

最后需要说明,这是对公开进展的整理与od体育的取向,并非对某个具体准确率的承诺。高速小球追踪在研究里进展很快,但离“任何手机、任何场馆都可靠”还有距离。把这个距离如实告诉用户,比给出一个漂亮的球速数字更有价值。与之相关的另一条线索,是人与器材如何被一起理解,可以回到《体育AI开始从“识别人”转向“理解人和器材的互动”:od体育观察多模态运动模型》。