人工智能AI 应用智能硬件本地部署可穿戴AI Agent【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址https://gitcode.com/GitHub_Trending/op/OpenGlass点击查看免费下载导读本文以 OpenGlass 智能眼镜开源项目Turn any glasses into AI-powered smart glasses中的一张真实评测样本prompts/series_1/img_20.jpeg为对象完整复盘该仓库的多模态视觉语言模型VLM图像描述流水线是如何对同一张低辨识度模糊抽象图进行多模型对比评测的。你将看到评测脚本如何批量驱动 Ollama 上 4 个模型默认 moondream、llava-llama3、llava:34b-v1.6、moondream:1.8b-v2-fp16生成描述、描述文本如何在img_20.md中按固定格式落盘以及四个模型针对这张无实体、仅由绿/棕模糊渐变与噪点构成的图片分别给出了哪些差异巨大的输出——并由此理解图像描述质量评价含幻觉、过度泛化、细节漏报这一环节在 OpenGlass Agent 视觉问答链路中的位置与作用。一、样本背景img_20 到底是什么样的图片先对齐证据。prompts/series_1/目录中存放了 57 张评测图img_1 至 img_57jpeg 与同名 md 成对出现img_20.jpeg是其中一张竖幅图600×800。从画面本身看它没有任何可命名的实体对象画面主体是左半侧暗棕/土黄调与右半侧青绿调之间柔和渐变融合的模糊色块底部融为暗青黑伴随明显的颗粒噪声全图没有清晰轮廓、文字或纹理。关键点这不是渲染失败的废图而是被刻意纳入评测集的语义模糊级low-recognition / abstract样本。它在评测中的作用是专门探测 VLM 面对不存在明确语义目标的输入时是会老老实实描述色彩与画质还是会脑补出不存在的物体。二、评测机制prompts/generate.ts 如何批量驱动多模型img_20.md不是手写的而是由仓库根目录的 prompts/generate.ts 批量脚本自动生成的。其流程如下遍历prompts/下的每个 series 目录收集所有.jpeg文件见 generate.ts并把输出路径定为同名.md文件依次执行 4 组模型描述测试每组把模型输出以####标题####分隔块追加进outputsDescription调用 imageDescription 的默认模型moondream:1.8b-v2-fp16Description (llava-llama3)传入llava-llama3Description (llava:34b-v1.6)传入llava:34b-v1.6Description (moondream:1.8b-v2-fp16)显式传入moondream:1.8b-v2-fp16与默认模型结果互为对照脚本末尾用fs.writeFileSync把拼接结果写回对应 md 文件见 generate.ts并使用cli-progress打印进度条。这意味着img_20.md中每一个####Description (xxx)####块都对应一次真实的 Ollama 推理请求。三、底层调用链从 generate.ts 到 Ollama 推理imageDescription的核心实现位于 imageDescription.tsexport async function imageDescription(src: Uint8Array, model: KnownModel moondream:1.8b-v2-fp16): Promisestring { return ollamaInference({ model: model, messages: [{ role: system, content: You are a very advanced model and your task is to describe the image as precisely as possible. Transcribe any text you see. }, { role: user, content: Describe the scene, images: [src], }] }); }随后进入 ollama.ts 的ollamaInference请求体向keys.ollama即环境变量EXPO_PUBLIC_OLLAMA_API_URL见 keys.tsPOSTstream: false的/api/chat请求携带model与 messages图片编码Uint8Array图片经 toBase64 转为 base64 字符串后放入images字段文本规整消息与输出都经过 trimIdent 去除公共缩进避免 prompt 里的多行缩进污染模型输入容错重试请求被backoff包裹实现见 time.ts 的createBackoff失败时按指数退避重试默认 minDelay 250ms、maxDelay 1000ms、maxFailureCount 50保证长批量评测的稳定性。支持的全部模型在KnownModel联合类型中定义见 ollama.ts包括llama3、llama3-gradient、llama3:8b-instruct-fp16、llava-llama3、llava:34b-v1.6、moondream:1.8b-v2-fp16等。四、四模型实测输出同一张模糊图四种截然不同的解读以下为img_20.md中记录的、四组真实模型输出的完整对比保持原文英文随后给出分析评测分组模型输出原文Descriptionmoondream:1.8b-v2-fp16默认The image features a green and gray color scheme, with the majority of the scene being in shades of green. There is a large section of green that appears to be blurry or fuzzy, giving it an artistic or dreamy appearance. The background consists of two vertical lines, one on each side of the frame, which further emphasize the green elements within the image.Description (llava-llama3)llava-llama3The image captures a close-up view of an abstract design on a dark blue background. The design is composed of small, square-shaped elements that are colored in shades of green and orange. These elements are arranged in a diagonal line across the image, creating a sense of movement and dynamism. The color gradient varies from green to orange, adding depth and dimension to the design. The overall effect is one of modern art, characterized by its use of geometric shapes and abstract colors.Description (llava:34b-v1.6)llava:34b-v1.6The image youve provided appears to be extremely blurry and low resolution, making it difficult to discern any specific details. The colors are muted, with shades of green and blue dominating the scene. Due to the lack of clarity, I am unable to provide a detailed description or transcribe text if there is any. If you have a higher-quality image or more context, please share so that I can assist you better.Description (moondream:1.8b-v2-fp16)moondream:1.8b-v2-fp16The image features a beautiful view of the sky, with its blue and green hues blending together to create an awe-inspiring scene. The sky appears to be slightly blurred, adding a softness and dreamy quality to the overall composition.五、逐条点评从这四条输出你能学到什么5.1 默认 moondream贴近画面但引入无中生有的线条moondream默认模型正确地抓住了green and gray / blurry or fuzzy / artistic or dreamy这些画质与色调事实但对画面右下方实际的噪点/渐变过渡物它描述为two vertical lines, one on each side of the frame——这与样本实际内容并不完全吻合属于低置信度幻觉模型试图把不存在的结构解释成线条。这正是评测模糊样本的第一个价值观察模型是否会虚构结构。5.2 llava-llama3最严重的过度泛化llava-llama3 的输出把模糊色块脑补成了一幅由绿色与橙色小方块构成、斜向排列、具现代艺术感的抽象设计。原文画面并无离散的方块元素橙色也并非画面主色。这说明 llava-llama3 在低信息输入下用训练先验补全了视觉内容——它倾向于把模糊翻译成艺术来维持描述的连贯性。对 OpenGlass 这类实时眼镜场景而言这种过度泛化会直接污染后续的问答证据。5.3 llava:34b-v1.6最诚实的拒绝回答llava:34b-v1.6 是四个输出中唯一承认自身局限的它明确说出extremely blurry and low resolution……unable to provide a detailed description并提示用户提供更高质量图片。它正确报告了 muted colors、green and blue 等有限信息但把右侧青绿区误报为蓝色。从评测角度这代表低信息输入下的保守策略——宁可少说也不编造。5.4 默认 moondream第二组与 5.1 同一模型的随机性对比第二组 moondream 输出把它描述为a beautiful view of the sky……blue and green hues blending——与第一组 moondream 输出并不一致。同一模型、同一图片、两次推理产生不同描述一个说绿色/灰色两条线一个说天空/蓝绿渐变说明模糊样本下的输出具有明显的采样随机性也解释了评测脚本为何用两个分组重复调用默认模型。5.5 四模型对比小结维度默认 moondreamllava-llama3llava:34b-v1.6moondream重复组色调还原绿/灰基本准确绿/橙/深蓝背景部分虚构绿/蓝蓝为误报蓝/绿蓝为误报结构描述虚构两条竖线虚构方块斜向排列承认无法分辨虚构天空画质判断模糊/梦幻现代艺术模糊/低分辨率准确模糊/柔和幻觉程度中高低保守中六、这套评测在 OpenGlass Agent 中的实际用途6.1 图像描述是先描述、后问答管线的第一环在 Agent.ts 中用户拍下的照片会先经过imageDescription生成文本描述并存入#photos见 Agent.ts当用户提问时answer()把所有照片描述拼接后交给llamaFind即 Groq 的 llama3-70b-8192见 imageDescription.ts 与 groq-llama3.ts回答问题期间还会调用 OpenAI TTS见 openai.ts 的textToSpeech。因此img_20这类模糊样本一旦被加入评测集就直接回答了一个工程问题当用户在低光照/低画质下拍照提问时哪一层的描述会失真上文的对比表明对模糊图最稳妥的策略是 llava:34b-v1.6 的保守拒绝或 moondream 的画质描述而 llava-llama3 的过度泛化会作为错误证据传给下游问答模型。6.2 与 imageBlurry 质量闸门的关系仓库还提供了专门的图像质量判定函数 imageBlurry用moondream:1.8b-v2-moondream2-text-model-f16回答这张图是否模糊/损坏/低质量YES or NO。generate.ts 中这段评测被注释掉说明它属于预留的评测能力未来可以在描述之前先用 Blurry 闸门拦截低质量照片避免把模糊图的幻觉描述送入问答管线。img_20 恰好就是这类闸门最典型的拦截对象。七、如何复现与扩展这套评测复现img_20.md的生成过程本地安装并启动 Ollama确保默认模型可用README 中给出的步骤是ollama pull moondream:1.8b-v2-fp16见 README.md在 keys.ts 中通过环境变量EXPO_PUBLIC_OLLAMA_API_URL配置 Ollama 服务地址默认应为http://localhost:11434/api/chat见 README.md在prompts/series_1/下放入新的.jpeg评测图运行ts-node prompts/generate.ts或按 package.json 中的脚本即可得到带 4 个####Description####分块的同名.md文件若需加入更多模型在KnownModelollama.ts中扩展模型名并在 generate.ts 追加一组runTest调用即可取消 generate.ts 的注释还可开启 Blurry 质量判定评测。八、结论prompts/series_1/img_20.md这份评测记录展示了 OpenGlass 团队评估多模态模型的一种务实方法用真实眼镜场景可能遭遇的低质量照片对比多个开源 VLM 的描述输出从而为下游 Agent 问答管线选择更稳的描述策略。从本文的逐条对比可以看到模糊抽象样本能最有效地暴露模型的幻觉与过度泛化倾向而保守描述 质量闸门拦截是当前代码库imageDescription.ts、imageBlurry.ts、Agent.ts给出的可行工程答案。如果你正在为自己的视觉 Agent 选择图像描述模型建议用类似 img_20 的样本集先跑一遍多模型对比再决定默认模型与质量过滤策略。赞分享人工智能AI 应用智能硬件本地部署可穿戴AI Agent【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址https://gitcode.com/GitHub_Trending/op/OpenGlass点击查看免费下载相关推荐spring-boot-demo 实战Spring Boot 整合 Redis 缓存与 Lettuce 连接池完整指南spring boot demo 实战Spring Boot 整合 Redis 缓存与 Lettuce 连接池完整指南 本篇技术指南以 spring boot人工智能AI 应用智能硬件本地部署可穿戴AI AgentOpenGlass 多模态视觉评测实践基于 Ollama 的图像描述数据集生成与多模型对比OpenGlass 多模态视觉评测实践基于 Ollama 的图像描述数据集生成与多模型对比 本篇技术指南围绕 OpenGlass 开源智能眼镜项目中 prom人工智能AI 应用智能硬件本地部署可穿戴AI AgentOpenGlass 视觉模型图像描述评测解析以 prompts/series_1/img_12.md 为例的多模态模型对比OpenGlass 视觉模型图像描述评测解析以 prompts/series_1/img_12.md 为例的多模态模型对比 OpenGlass 是一款将普通眼人工智能AI 应用智能硬件本地部署可穿戴AI Agent上一篇终极Google Breakpad符号文件生成指南从调试信息到可读堆栈跟踪的完整流程下一篇深度解析Readium-js-viewer的架构设计与模块化实现原理创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考