Spike: MNN + Qwen2.5-VL-2B iPhone 推理延迟实测
Spike ID: 001 日期: 2026-06-18(创建) 状态: 待执行
假设
我们认为 Qwen2.5-VL-2B (INT4) 在 iPhone 14+ 上能做到单帧推理 < 2 秒,满足 1fps 实时检测需求。
方法
- 在 iPhone 上编译 MNN iOS Chat App(或从 taobao-mnn 下载预编译)
- 加载 Qwen2.5-VL-2B INT4 权重
- 用 5 张 CPR 练习场景照片做推理,记录:
- 模型加载时间(冷启动)
- prefill 速度(tok/s)
- decode 速度(tok/s)
- 端到端单帧推理耗时
- 内存峰值(Xcode Instruments)
- 5 分钟连续推理后设备温度
机型 / 环境
| 项目 | 值 |
|---|---|
| 设备 | iPhone 14 / 15(待定) |
| OS 版本 | iOS 18.x |
| MNN 版本 | 最新 release |
| 模型版本 | taobao-mnn/Qwen2.5-VL-2B-A4B |
数据
待实测
结论
待填写
对架构的影响
- 若 < 2s:1fps 方案可行,维持 edge-runtime.md 现有设计
- 若 2-5s:降为 0.5fps 或改为关键帧触发式检测
- 若 > 5s:需考虑换更小模型或简化 prompt