该文章提出了一种基于大语言模型(LLM)的多模态自动化框架,用于扫描电子显微镜(SEM)图像中的比例尺检测与提取,解决了传统手动操作效率低、易出错的问题,同时在检测精度和泛化能力上有显著突破。一、文章主要内容总结研究背景:SEM图像的比例尺检测是微观分析的关键步骤,但传统依赖人工或经典图像处理工具(如ImageJ、OpenCV)的方法,存在效率低、易受复杂背景/非标准比例尺影响的局限性。核心框架:采用四阶段流程实现自动化处理自动数据集生成(Auto-DG):基于NFFA-EUROPE和IDR数据集,合成含不同形状、尺寸、方向比例尺的SEM图像,解决标注数据稀缺问题,保障模型泛化能力。比例尺目标检测:使用YOLOv5深度学习架构,实现比例尺的精准定位,在IoU=0.5时精度达100%、召回率95.8%、mAP 99.2%。信息提取:采用混合OCR系统(CnOCR负责通用文本识别,PaddleOCR专注数字识别),结合欧氏距离关联比例尺与文本,在Auto-DG数据集上精度89%、召回率65%、F1值75%,优于单一OCR引擎。LLM验证与反馈:引入LLaMA3-70B(基于LangChain)作为推理引擎,验证提取结果合理性、识别异常并建议后续步骤,相关问题回答准确率达70%,优于通用多模态LLM(如Llama 4 Maverick/Scout)。