这是「拳神AI视觉算法研究」系列的第四篇。系列顺序:难点(一)→ 数据底座(二)→ 解决方案(三)→ 达到的水平(本篇)→ 对拳击的意义(五)。所有数字来自生产环境实测(2026-08 潘豪VS文达对练 72.5/B、空击评分链路、计数工具真机验证、WSL2 迁移基准),评分可复现,模型弱点公开。

前三篇,我们把难题拆开、把数据底座亮出来、把四个解法(BoxLock / Z-score 出拳 / ReID 指纹 / TRT+WSL2)逐一讲清。

这一篇回答最关键、也最容易被营销话术糊弄的问题:

这套系统,现在到底达到了什么水平?和学术、和商业系统比,它处在哪一格?

我们的答案不包装,直接钉死在实测指标上。

0. 先摆结论,免得你被标题党带偏

一句话:这是业余拳击量化评估的「可用基线」,不是职业级精确系统。在「零穿戴 + 单目 + in-the-wild(非受控手机视频)」这个细分方向上,它是目前少见的端到端可用实现。

"可用"两个字,是认真用的,不是客气话。它意味着:你传一段手机拍的空击/对练,系统能稳定跑完、产出可复现的数字、且数字能回溯到具体帧。它不意味着:每一拳都数得准、拳种都认得清、能当裁判判分。

下面所有的指标,都在划这条"可用"的边界。

1. 工程指标:生产环境实测,没有理想值

先列硬数字。这些都是真跑出来的,不是论文里的理想峰值。

实测值说明
TRT 三模型推理26.6ms/帧 ≈ 37 FPSvs torch fp32 69ms,推理层提速 2.6x
duo 全链路(1080×1920 竖屏)12.8 FPSGPU,追踪优化后;瓶颈在追踪/后处理,不在推理
真实素材(潘豪VS文达)10765 帧 / 14 分钟端到端 12.8 FPS 跑完
综合评分72.5 / BL1 80.0 / L2 63.3;7 维 90/85/55/90/60/44.9/85
WSL Worker 连生产task=2 → 73.2 分落库 ✅端到端闭环打通

一个必须说清的认知:单模型快 ≠ 端到端快。TRT 把三模型推理压到 37 FPS,听起来很美,但全链路(检测+追踪+后处理)只到 12.8 FPS。追踪和后处理才是真瓶颈——这是很多"模型很快"的叙事故意掩盖的真相。拳神选择把真数字亮出来,而不是只晒那张 37 FPS 的推理截图。

2. 分层能力定位:哪层能信,哪层要打问号

把系统从底层到顶层拆开,每层诚实标注当前所处的阶段:

① 检测层(person / pose / glove)——「可用」

② 出拳事件层——「弱监督原型级」

③ 拳种层——「不承诺精度」

④ 评分层——「可复现、可解释」

3. 与学术同类工作比:精度高,但落不了地

学术界做 pose-based boxing / combat action recognition,多在受控环境:固定机位、多视角、标记手套、专业选手、已知相机参数。这种条件下精度很高,论文很好看。

但代价是:不可部署到业余 in-the-wild 场景。你不可能要求一个业余爱好者打拳时,架三台标定好的相机、戴标记手套、找专业标注者跟拍。

拳神的差异化恰恰在这里:单路手机视频 → 7 维可解释评分,在业余场景首次跑通端到端。我们不比谁的实验室精度高,我们比谁能真的在拳馆里用起来。

4. 与商业系统比:我们刻意选了"低硬件依赖"

职业赛事追踪系统(多相机阵列 + 穿戴 / 专用硬件)精度高、成本低不起。它们是"高硬件依赖"那一格。

拳神是零穿戴、单目、零额外硬件——代价是绝对精度低于多传感器方案。这不是能力缺口,是刻意的设计权衡:我们选了"任何人掏出手机就能用"这条路,而不是"配齐硬件才准"那条路。

5. 行业差异化矩阵:我们独占一格

把主流方案按两个轴摆开,拳神的位置一目了然:

``` 受控环境 ←──────────────────→ in-the-wild(单路手机) 多传感器/穿戴 │ 学术 / 职业商业系统 │ 少数职业转播系统 (高硬件依赖) │ (精度高,不可部署到业余) │ (多机位 + 穿戴) ───────────────┼──────────────────────────────┼────────────────── 零穿戴 │ (空白:无实际场景) │ ★ 拳神AI (低硬件依赖) │ │ 独占格 ```

这一格不是"精度最高",而是唯一把「业余可用 + 零穿戴 + 合规」三条同时拉满的。矩阵就是"在零穿戴单目 in-the-wild 细分方向,是目前少见的端到端可用实现"这句话的几何证明。

6. 诚实边界:已知局限,一条不藏

硬核文章的灵魂是敢说弱点。拳神AI 当前已知局限:

1. 出拳检测 F1=0.053、稀有拳种召回 0 → 拳种只给分布,不写识别率; 2. 实时性未达标:全链路 12.8 FPS < 30fps 实时线,拳馆现场需 `fps_skip=1~2` 或降分辨率; 3. 手套漏检窗口:极端遮挡丢拳时依赖手腕关键点,仍有漏检; 4. 贴身 clinch:ReID 指纹可能短暂混淆,靠开局锚定 + 人工在环兜底。

这些不是部署 bug,是算法范式本身的 ceiling:用规则、用阈值、用统计突变,能绕开数据缺口,却绕不开复杂拳击动作的语义判别。

7. 2.0 升级主线:从「救火」到「升空」

1.0 用四个成熟技术把系统从"不可能"拉到"可用"。2.0 的主线是把规则换成学习——而且是在数据依然稀缺这个硬约束下学习。燃料是数据飞轮。

模块1.0 现状真实痛点2.0 升级方向预期增益(目标,非已达成)
出拳检测Z-score 速度突变F1=0.053骨骼序列时序模型(ST-GCN / LSTM-Attention / 轻量 Transformer)二分类F1 0.053 → 0.6+
拳种识别常规分类器稀有类召回全 0度量学习 + 骨骼增强 + 主动学习补标稀有类 0 → 可区分
追踪MOSSE/KCF 相关滤波快速运动/遮挡退化检测跟踪一体(ByteTrack / BoT-SORT)+ 骨骼外观 ReID换位移位不丢人
姿态底座YOLOv11-pose 单帧 2D转身/下潜深度歧义时序姿态(MotionBERT)+ 3D 姿态转身/闪避可评
部署实时WSL2 + TRT fp3212.8 FPS 勉强INT8/FP16 量化 + 边缘 Orin/Jetson实时 12.8 → 30+

优先级与代价(诚实 ROI):立即做(零硬件依赖、ROI 最高)的是出拳 ST-GCN 二分类、追踪 ByteTrack、Z-score→学习,它们直接打在 F1=0.053 与召回=0 两个最痛点上;中期是有门槛但增益结构性的 3D 姿态、自监督预训练;谨慎 / 不做的是视频大模型(成本与延迟不匹配业余场景,且可解释性差,违背"AI 点评须挂靠真实数字"的红线)、不碰人脸(合规铁律)、不盲目上单目 3D 重建(非约束场景下误差大)。

8. 小结 + 下篇预告

本篇用工程实测指标、与学术/商业系统的对比、一张行业差异化矩阵,把拳神AI 现在的真实位置钉死:

可用到底等于什么水平?答完了。下一篇:对拳击的意义——技术最终要回到人:这套系统对拳击爱好者意味着什么,对拳击运动这个行业又意味着什么。

_数据不骗人。拳神也不该。_

👇 想看你的真实数据?点文章底部「阅读原文」进官网 boxingai.cloud,拍段 30 秒空击传上去,看你的 7 维趋势线——出拳频率、连击、节奏、体力、移动,哪一项在涨、哪一项卡住了,一目了然。(链接已带渠道标记,你的访问会被准确计入。说明:空击场景我们只给可复现的技术趋势,不报命中率、不写拳种识别率。)