
Mano-P端侧优化深潜视觉Token剪枝混合精度量化让4B模型流畅跑在笔记本【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目支持在 Mac mini/MacBook 上或通过算力棒本地运行推理实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-PMano-P 是一个专为边缘设备设计的开源 GUI-VLA Agent 项目。它通过视觉 Token 剪枝与混合精度量化两大端侧优化技术让 4B 参数的 GUI 操作模型直接流畅跑在 Mac mini/MacBook 上截图与任务数据完全不出设备实现纯视觉驱动的本地 GUI 自动化。对很多人来说4B 视觉大模型和笔记本电脑是两个很难放在一起的词高分辨率截屏会产生海量视觉 Token推理时既要大量内存又要求高带宽。Mano-P 的思路不是把模型变小而是在保留能力的前提下把每一步的计算和存储成本压到端侧能承受的水平。一、端侧优化前先搞清楚GUI-VLA 模型卡在哪儿Mano-P 的模型是典型的看截图 → 思考 → 出动作的 VLAVision-Language-Action结构每一步都要把整张高分辨率屏幕截图喂给视觉编码器再让语言模型规划下一步点击、输入或滚动。这意味着两个成本大头视觉 Token 数量一张 2K 截图切块后可能对应上万枚视觉 Token它们进入注意力层的计算量和上下文长度直接翻倍权重与激活的精度FP16 权重体积大、访存带宽需求高在统一内存架构的 Mac 上尤其吃紧。官方在技术背景一节明确给出了端侧版的优化路线混合精度量化 视觉 Token 剪枝 边缘推理自适应详见 README.md。二、视觉 Token 剪枝只保留界面里的关键信息屏幕截图里其实大部分区域是无效信息大面积留白、重复的背景纹理、无交互价值的装饰元素。Token 剪枝要做的就是在进入语言模型之前把视觉 Token 大幅压缩只留下语义关键的部分。Mano-P 采用的剪枝思路GSPruning可以概括为两点锚点保留全局空间结构通过锚点维持界面骨架的空间布局模型依然知道按钮在左还是在右语义异常值捕获关键 UI用离群点检测找出文本、图标等语义显著的元素保证关键控件不被剪掉。效果如何看官方在 Online-Mind2Web 上的实测每张图片平均 Token 保留率越低剪得越狠训练吞吐越高说明剪枝收益越大配置Avg. Tokens/img保留率↓训练吞吐samples/s↑任务成功率 SR ↑Qwen3VL-2B 基线微调100%5.090.390FlashVLM12.55% 保留12.55%17.010.343Mano-CUA 1.125.09% 保留25.09%20.040.370Mano-CUA 1.112.57% 保留12.57%22.620.336也就是说只保留约1/8 的视觉 Token就能拿到全场最高的训练吞吐而任务成功率只从 0.390 降到 0.336——在 4B 基座上GSPruning 在同样 25% 保留率下把吞吐做到 16.72、SR 0.400几乎逼近 0.425 的不剪枝基线原始数据见 README.md。对端侧的意义每步推理的 prefill 长度直接砍到几分之一这就是流畅跑在笔记本的第一块基石。三、混合精度量化W8A8 补齐 MLX 的能力空缺剪枝解决了算得少量化要解决存得省、搬得快。原生 MLX 只提供仅权重量化W8A16 / W4A16权重压到 INT8但计算时仍要反量化回 FP16 走 FP16 矩阵乘——内存省了算力没省。Mano-P 配套的Cider 推理加速 SDK补齐了缺失的W8A8 / W4A8 激活量化原语权重 INT8、激活也在线量化为 INT8用 INT8 TensorOps 直接做矩阵乘形成真正的混合精度推理路径SDK 定位见 README.md。Mano-CUA-4B 在 Apple M5 Pro307 GB/s 带宽上的实测量化配置Prefill 耗时s解码速度tokens/sW8A16基线2.83980.1W8A8Cider2.519约快 12.7%79.5几个值得注意的细节量化粒度可调per-channel 最快算子级 prefill 最高 1.8xper-groupgs64/128在速度之间换取更高精度官方提供了完整的粒度-速度-精度对照表见 README.md通用性强Cider 兼容任意 MLX 模型在 M5 Pro 上相对 MLX 原生 W4A16 可实现1.4x–2.2x 的 prefill 加速并非 Mano-P 专属内存提醒W8A8 需要同时持有原始权重与 INT8 权重16GB 设备建议预留4GB 以上空闲内存否则换页开销可能吃掉加速收益官方说明见 README.md。四、优化成果OSWorld 专业模型第一本地实测 56% 通过率端侧优化最怕省了性能、丢了效果。Mano-P 的答案是能力没有牺牲反而是专精训练 高效部署的双赢。OSWorld 专业 GUI Agent 模型榜单第一Mano-CUA 1.1 成功率58.2%领先第二名 13.2 个百分点本地 vs 云端对比MacBook Pro · M5 · 16GB100 个真实 macOS GUI 任务本地Mano-CUA-2.0-4B 通过率 56.0%平均单步 7.9s内存占用约6.4GB而云端通用模型 Qwen3-VL-Plus 仅 39.0%——本地 4B 专精模型完胜云端大模型。五、上手指南硬件要求与部署方式端侧优化的最终红利是普通用户开箱即用的部署门槛部署方式硬件要求说明Mac 直装Mac mini / MacBookM4 芯片 32GB 内存本地模式截图零外发算力棒任意 Mac USB 4.0 及以上接口算力棒本地推理大参数量模型也能跑本地模式的核心保障所有推理在设备内完成截图和任务描述永远不会发送到外部服务器适合金融、法务等高安全场景完整隐私说明见 README_CN.md。六、总结Mano-P 证明了一条清晰的端侧路线视觉 Token 剪枝GSPruning把每步的视觉输入压到 12%–25%prefill 成本骤降而任务成功率基本无损混合精度量化W8A8 / W4A8用 Cider 补齐激活量化prefill 再提速约 12.7%解码稳定在 ~80 tokens/s能力不打折OSWorld 专业模型 58.2% 第一本地实测 56% 通过率反超云端通用模型。对于想在笔记本上拥有数据不出设备的私有 GUI Agent 的开发者这套剪枝 量化 边缘自适应的组合拳是目前最值得研究的开源端侧范本。项目以 Apache 2.0 协议 开源训练方法、剪枝与量化技术将在第三阶段完整放出。【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目支持在 Mac mini/MacBook 上或通过算力棒本地运行推理实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考