Jev-Omni基准评测深度解读MMAU 63%与MVBench 53%背后12B多模态模型的真实水平有多强【免费下载链接】Jev-Omni项目地址: https://ai.gitcode.com/hf_mirrors/akhilaaa3/Jev-OmniJev-Omni 是一个基于 Gemma 4 12B 构建的多模态决策分类器同时支持文本、图像、音频、视频四种输入。它不走生成文字答案的老路而是直接为每个选项输出一个校准过的概率值。官方评测中它在 MMAU 上取得63.10%微平均准确率在 MVBench 视频基准上取得53.10%。这两个数字到底算什么水平这篇文章带你逐项拆解。1 分钟看懂 Jev-Omni它和聊天模型有什么本质区别 普通多模态大模型回答问题的方式是写一段话答案藏在生成的文字里Jev-Omni 换了一条路线输入一段上下文状态 一个问题 若干候选选项2 到 256 个建议不超过 20 个输出每个选项的概率例如Yes: 93.99% / No: 6.01%不生成解释文本因此输出 token 为零推理既快又便宜实现上模型在标准的多模态主干48 层、hidden_size 3840之后挂了一个决策头把最后一个隐藏状态映射到 256 个选项槽位再取 softmax。核心推理逻辑见 jev_omni.py配置细节在 decision_config.json。MMAU 63% 是什么水平横向对比一眼看懂先看官方给出的完整成绩单来自 README.md基准测试题量成绩DecisionBench Medium293 题 / 80 场景87.57%JevBench231 个决策 / 195 组86.15%MMAU1,000 题63.10%微平均MVBench2,786 题 / 14 个任务53.10%再把 Jev-Omni 放进开源大模型坐标系同表数据模型参数量MMAUMVBenchJev-Omni12B63.10%53.10%Inkling975B 总参 / 41B 激活77.20%—Qwen3.5-397B-A17B397B 总参 / 17B 激活—77.60%结论直白地说✅MMAU 63%MMAU 是公认偏难的多模态理解基准以音频理解著称12B 的 Jev-Omni 拿到 63%而参考的 975B 巨型号是 77.2%。差距约 14 个百分点说明小模型分类头路线在理解深度上还没能逼近超大 MoE 模型但考虑参数量差了两个数量级这个分数不丢人。⚠️MVBench 53%这是最需要冷静的数字。MVBench 是视频理解基准大量任务接近二选一53% 仅略高于闭着眼瞎猜距离 397B 模型的 77.6% 还有很大距离。视频是目前最弱的一环。DecisionBench / JevBench 87%在自己的主战场决策分类上表现是真正的第一梯队。一个隐藏亮点校准度 ECE 0.0400很多模型答对了但不知道自己对不对。Jev-Omni 在 DecisionBench Medium 上的 ECE期望校准误差仅0.040010 分箱越低越好——也就是说它说我有 90% 把握时大约有 90% 是真的。对工程落地来说这比裸准确率更值钱你可以直接拿概率值做置信度阈值、风险分层而不需要再训练一个校准层。上手体验一条命令跑通四模态硬件门槛不高一张能放下约 50 GB FP32 权重的 CUDA 显卡即可推理用 BF16 自动转换模型包约 24 GB。依赖清单见 requirements.txt音频输入还需 ffmpeg。pip install -r requirements.txtPython 侧核心只有两步加载模型调用predict()。完整可运行示例在 example.py最小调用长这样from jev_omni import load_jev_omni classifier load_jev_omni() result classifier.predict( stateThe meeting starts at 10 AM. It is now 9 AM., questionHas the meeting started?, options[Yes, No], )需要本地文件时 clone 仓库即可git clone https://gitcode.com/hf_mirrors/akhilaaa3/Jev-Omni性能实测H200 预热后20 次中位数输入延迟约 2k token 文本83 ms单张图片26 ms13 秒音频31 ms16 帧视频504 ms使用限制音频截断到 30 秒视频均匀采样 16 帧选项数建议 ≤ 20 个决策头上限 256 个但超过 20 个后质量未经验证。总结这份成绩单该怎么读 维度评价决策分类主战场⭐⭐⭐⭐⭐ 87%同尺寸里的强手音频/文本理解MMAU 63%⭐⭐⭐ 中规中矩小模型的合理水位视频理解MVBench 53%⭐⭐ 接近随机明显短板概率校准ECE 0.04⭐⭐⭐⭐⭐ 可直接用于生产决策成本与速度⭐⭐⭐⭐⭐ 无输出 token毫秒级响应一句话总结Jev-Omni 不是要你用它挑战所有多模态 SOTA而是给你一个又小又快、概率可信、单次调用几分钱的四模态决策引擎。如果你的场景是把结构化问题是/否、多选、打分变成自动化决策它目前的真实水平已经够用如果你的场景是复杂视频推理53% 的 MVBench 提醒你先别指望它。完 · 模型基于 Apache-2.0 协议开源可自由商用详见 README.md【免费下载链接】Jev-Omni项目地址: https://ai.gitcode.com/hf_mirrors/akhilaaa3/Jev-Omni创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考