这是「拳神AI视觉算法研究」系列的第一篇。整个系列会拆开讲清楚:难点(本篇)→ 数据底座 → 解决方案 → 达到的水平 → 对拳击的意义。所有数字来自生产环境实测(2026-08 潘豪VS文达对练、计数工具真机验证、WSL2 迁移基准),评分可复现,模型弱点公开。

0. 先说约束,因为约束定义架构

输入是一段普通手机 / 擂台摄像头录下的单路 RGB 视频(常见 1080p、30–60fps、HEVC / H.264)。输出是可复现的 7 维两层评分 + 双侧出拳统计 + 集锦锚点

三个硬约束把问题钉死:

这决定了我们做的是:在 in-the-wild(非受控)、单目、无标记条件下,弱监督地重建一场拳赛的运动学并映射到评分。这不是一个被充分解决的学术问题——难点恰恰在这里。

图0:拳神AI 视觉分析流水线——单路视频到 7 维评分的端到端路径与四条红线
图0:拳神AI 视觉分析流水线——单路视频到 7 维评分的端到端路径与四条红线

1. 难点一:单目重建的病态性

从 2D 像素恢复 3D 运动学本质上是病态问题

拳击又是近距高速运动,透视畸变和自遮挡放大了这种不确定性。

我们的取舍:刻意不做 3D 重建,只保留 2D 图像平面上的相对运动学(速度、角速度、位移)。这些是单目可观测且稳定的部分——出拳快慢、组合密度、步伐跨度在 2D 平面上已经能区分好坏,不必冒 3D 重建的病态风险。

图1:单目重建的病态性——单帧 2D 投影对应无限多 3D 可能,尺度/内参/深度均不可逆
图1:单目重建的病态性——单帧 2D 投影对应无限多 3D 可能,尺度/内参/深度均不可逆

2. 难点二:拳击运动学的极端时序特性

拳击不是走路、不是挥手,它的运动学分布对算法极不友好:

这三类特性叠加,使"逐帧检测 + 后处理"在业余视频上直接崩:高速带来模糊和漏检,短促带来边界难定,遮挡带来轨迹断裂。任何一个单独可控,三个同时来就是地狱难度。

图2:极端时序特性——出拳有效相仅 200–400ms、tip 速度 8–15 m/s、单帧位移大导致运动模糊
图2:极端时序特性——出拳有效相仅 200–400ms、tip 速度 8–15 m/s、单帧位移大导致运动模糊

3. 难点三:长尾数据分布

业余数据集里 jab / cross 占绝对多数,hook / swing / uppercut / body shot 样本极少。留一法(LOO)实测:

任务指标
出拳检测LOO F10.053
拳种分类LOO acc0.532
hook / swing / uppercutLOO 召回全 0

稀有类召回为 0 不是模型不行,是没有正样本可学。任何"识别率%"都是幻觉。

长尾的直接后果:监督信号被 majority 类绑架,模型退化为"只会认 jab / cross"。这是数据现实的硬约束,不是工程能绕过的——除非先解决数据(见系列第二篇:数据底座)。

图3:长尾数据分布——jab/cross 占多数,稀有拳种样本极少,LOO 召回为 0
图3:长尾数据分布——jab/cross 占多数,稀有拳种样本极少,LOO 召回为 0

4. 难点四:实时性与精度的矛盾

30fps 实时线要求端到端 ≤ 33ms/帧。但我们要串联 person + pose + glove 三模型 + 追踪 + 后处理。

关键认知:单模型提速 ≠ 端到端提速。实测里 TRT 把三模型推理压到 26.6ms/帧(≈37 FPS),但全链路受追踪和后处理拖累,真实素材只有 12.8 FPS。瓶颈不在推理,在追踪和后处理——这是很多“模型很快”的叙事掩盖的真相。

图4:实时性矛盾——TRT 三模型 26.6ms/帧,但追踪+后处理拖累端到端到 78ms(12.8 FPS)
图4:实时性矛盾——TRT 三模型 26.6ms/帧,但追踪+后处理拖累端到端到 78ms(12.8 FPS)

5. 难点五:身份一致性(ReID 退化)

对练中两人换位、转身、衣着相似。两个朴素策略都会翻车:

贴身 clinch 时外观特征也退化,ReID 指纹短暂失效。身份一致性是双人场景下最容易被低估的难点。

图5:ReID 退化——换位后按颜色追踪跳变,贴身 clinch 时外观特征失效
图5:ReID 退化——换位后按颜色追踪跳变,贴身 clinch 时外观特征失效

6. 难点六:标注成本与噪声

这反过来限制了难点三里的监督信号——没有干净的大标注,长尾永远补不上。标注成本不是边角问题,是卡住整个系统上限的那块石头。

7. 小结:难点是耦合的,不是孤立的

这六个难点不是并列清单,而是相互咬合:

任何一个难点单拎出来都有成熟解法,但六个同时压在"零穿戴 + 单目 + in-the-wild + 合规"这四条约束下,就构成了拳神AI 真正要啃的硬骨头。 后续篇章会逐一给出我们的应对。

下篇预告

第二篇:数据底座——为什么拳神AI 的模型不是小数据玩具?通用底座建立在什么规模的数据上,拳击专项又是怎么在自建数万帧数据集上闭环迭代的。难点三和难点六的答案,就在数据里。

_数据不骗人。拳神也不该。_