0. 先说约束,因为约束定义架构
输入是一段普通手机 / 擂台摄像头录下的单路 RGB 视频(常见 1080p、30–60fps、HEVC / H.264)。输出是可复现的 7 维两层评分 + 双侧出拳统计 + 集锦锚点。
三个硬约束把问题钉死:
- 不处理人脸:只跑姿态 / 手套 / 出拳关键点,认人走人工在环 + BOXID,绝不上人脸识别。
- 零穿戴:业余拳手不可能每人戴 IMU 手套。一切运动学信息必须从视频里提取。
- 数据稀缺:业余标注数据极少,稀有拳种(hook / swing / uppercut)召回为 0。
这决定了我们做的是:在 in-the-wild(非受控)、单目、无标记条件下,弱监督地重建一场拳赛的运动学并映射到评分。这不是一个被充分解决的学术问题——难点恰恰在这里。
1. 难点一:单目重建的病态性
从 2D 像素恢复 3D 运动学本质上是病态问题:
- 尺度未知:同样的像素位移,可能是近处小手位或远处大手位,无参考物无法定标。
- 相机内参未知:业余视频的焦距、主点、畸变系数全无标定。
- 深度歧义不可逆:单帧 2D 无法唯一确定 3D——一个像素点对应射线上的任意深度。
拳击又是近距高速运动,透视畸变和自遮挡放大了这种不确定性。
我们的取舍:刻意不做 3D 重建,只保留 2D 图像平面上的相对运动学(速度、角速度、位移)。这些是单目可观测且稳定的部分——出拳快慢、组合密度、步伐跨度在 2D 平面上已经能区分好坏,不必冒 3D 重建的病态风险。
2. 难点二:拳击运动学的极端时序特性
拳击不是走路、不是挥手,它的运动学分布对算法极不友好:
- 高速:手套 tip speed 可达 8–15 m/s,单帧间位移大,运动模糊普遍。
- 短促:一次出拳有效加速相仅 200–400ms,事件边界难切。
- 高频遮挡:双拳彼此遮挡、躯干遮挡、贴身 clinch——检测器漏检率高。
这三类特性叠加,使"逐帧检测 + 后处理"在业余视频上直接崩:高速带来模糊和漏检,短促带来边界难定,遮挡带来轨迹断裂。任何一个单独可控,三个同时来就是地狱难度。
3. 难点三:长尾数据分布
业余数据集里 jab / cross 占绝对多数,hook / swing / uppercut / body shot 样本极少。留一法(LOO)实测:
| 任务 | 指标 | 值 |
|---|---|---|
| 出拳检测 | LOO F1 | 0.053 |
| 拳种分类 | LOO acc | 0.532 |
| hook / swing / uppercut | LOO 召回 | 全 0 |
稀有类召回为 0 不是模型不行,是没有正样本可学。任何"识别率%"都是幻觉。
长尾的直接后果:监督信号被 majority 类绑架,模型退化为"只会认 jab / cross"。这是数据现实的硬约束,不是工程能绕过的——除非先解决数据(见系列第二篇:数据底座)。
4. 难点四:实时性与精度的矛盾
30fps 实时线要求端到端 ≤ 33ms/帧。但我们要串联 person + pose + glove 三模型 + 追踪 + 后处理。
关键认知:单模型提速 ≠ 端到端提速。实测里 TRT 把三模型推理压到 26.6ms/帧(≈37 FPS),但全链路受追踪和后处理拖累,真实素材只有 12.8 FPS。瓶颈不在推理,在追踪和后处理——这是很多“模型很快”的叙事掩盖的真相。
5. 难点五:身份一致性(ReID 退化)
对练中两人换位、转身、衣着相似。两个朴素策略都会翻车:
- 按颜色认人:红蓝是开局锚定,换位后"红方"站到了画面右边,按颜色就错位。
- 按位置盯人:换向后当前左边的人变了,按位置数就会数错人。
贴身 clinch 时外观特征也退化,ReID 指纹短暂失效。身份一致性是双人场景下最容易被低估的难点。
6. 难点六:标注成本与噪声
- 关键点标注贵,业余数据尤其缺专业标注者。
- 出拳标注(punch_labeler)依赖人工,样本少且噪声大。
这反过来限制了难点三里的监督信号——没有干净的大标注,长尾永远补不上。标注成本不是边角问题,是卡住整个系统上限的那块石头。
7. 小结:难点是耦合的,不是孤立的
这六个难点不是并列清单,而是相互咬合:
- 单目病态(1)逼我们守在 2D,但 2D 下高速短促遮挡(2)更难;
- 长尾(3)和标注贵(6)是同一个数据问题的两面;
- 实时矛盾(4)让"多跑几次检测补遮挡"的朴素解法直接出局;
- 身份退化(5)让双人统计在没有强 ReID 时全盘失真。
任何一个难点单拎出来都有成熟解法,但六个同时压在"零穿戴 + 单目 + in-the-wild + 合规"这四条约束下,就构成了拳神AI 真正要啃的硬骨头。 后续篇章会逐一给出我们的应对。
下篇预告
第二篇:数据底座——为什么拳神AI 的模型不是小数据玩具?通用底座建立在什么规模的数据上,拳击专项又是怎么在自建数万帧数据集上闭环迭代的。难点三和难点六的答案,就在数据里。
_数据不骗人。拳神也不该。_
