如何用自己的标注样本校准AIHOT的精选标准SelectBench评测实战指南【免费下载链接】AIHOT一个自己找热点、自己写日报的网站框架。把信源和精选标准换成你的它就是你的行业热点站。项目地址: https://gitcode.com/gh_mirrors/ai/AIHOTAIHOT 是一个「自己找热点、自己写日报」的网站框架把信源和精选标准换成你的行业它就是你的热点站。但换行业后 AI 的精选判断是否合你的口味本文讲清 SelectBench 评测全流程自己标注 100–200 条样本、一键跑评测脚本、在后台逐条对比错例用标注样本把 AIHOT 的精选标准校准到位。为什么精选标准需要校准精选管线是固定的预筛通过后评分模型对每条资料独立打两次 0–100 分两次之和 ≥ 2 × 门槛才入选。门槛按信源分级区分T1 官方一手 60 分、T1_5 准官方 65 分、T2 媒体与个人 76 分。这组门槛是 AIHOT 在 AI 领域用的偏严标准——换了行业就不一定合适。好消息是不用凭感觉调AIHOT 内置了 SelectBench 闭环——标样本 → 跑评测 → 看错例 → 改标准 → 留出集验收每一步都有据可依。 精选标准写在哪里门槛数值industry/selection.ts —— 只有thresholds分级门槛和understandFloor两组数评分标准industry/prompts/selection-score.md —— 分「必须正常评价的价值」与「必须压住的噪声」两大块预筛industry/prompts/prefilter.md —— 宽召回只拦明显无关的资料。提示词版本就是它内容的哈希改了提示词之后的新资料按新版判断已判过的不会重算。第一步准备标注样本集gold.jsonl从自己的信源里挑100–200 条逐条标注「该选 / 不该选」存成.data/gold.jsonl.data/不进 Git。每行一条 JSON格式可对照 industry/gold.example.jsonl 里的两条示例{caseId:law-001,material:{title:原文标题,originalTitle:null,publishedAt:2026-10-01T09:00:0008:00,sourceName:信源名称,bodyZh:null,bodyOriginal:正文……},sourceFacts:{sourceKind:rss,sourceTier:T1,firstParty:true,language:zh},samplingContext:{benchmarkSplit:development,samplingStratum:regulation},gold:{decision:select}}字段填什么caseId唯一编号material标题、发布时间、信源名、正文bodyZh或bodyOriginal有一个就行sourceFacts信源类型、分级sourceTier决定用哪个门槛、是否一手、语言samplingContext可选。benchmarkSplit分开发集/留出集samplingStratum按自己分类如「新规」「判决」「营销」看错在哪一类gold.decisionselect该选 /reject不该选 /either两可不计入准确率 标注三建议多放难例「差一点该选、差一点不该选」的。一眼判断的放太多准确率会虚高留出留出集benchmarkSplit: holdout调提示词只看开发集最后用留出集验收免得把提示词调成只会做这几道题标注人就是以后读这个站的人或口味一致的人——精选标准校准的终点是读者体验。第二步一条命令跑 SelectBench 评测node --env-file.env scripts/eval-selection.ts --gold .data/gold.jsonl --split development --label 第一版评分标准脚本对每条样本跑一遍与线上一致的流程预筛 两次评分见 scripts/eval-selection.ts再与你的标注对比输出三样东西核心指标准确率、精确率选出来的有多少是对的、召回率该选的有多少选上了、F1、入选比例门槛扫描门槛从 40 到 90 每隔 2 分各会选出什么结果直接回答「应该松一点还是紧一点」错例明细完整报告写入.data/eval/并自动导入后台 SelectBench。常用参数--models default,deepseek-flash同批比较多个模型、--n 200限制条数、--split holdout只跑留出集。有回执复用机制同样的输入和提示词再跑不会重复调用模型迭代成本很低。第三步在后台 SelectBench 看错例、改标准后台「SelectBench」页每次运行一张卡片列出各模型的准确率、精确率、召回率、F1、耗时与 token 用量并自动给 F1 最高的模型打标。点进单条运行页页面实现apps/web/app/routes/admin/selectbench.tsx、apps/web/app/routes/admin/selectbench-run.tsx可以按误选 / 漏选 / 两可 / 模型之间有分歧筛选按自己标的samplingStratum分组定位「错在哪一类」展开单条查看模型给这条资料的完整理由和回执编号。对症下药策略原文见 docs/selection.md错例类型表现改哪里漏选FN该选没选上把「这类东西为什么重要」写进 selection-score.md 的「必须正常评价的价值」给出例子误选FP不该选却选上了写进「必须压住的噪声」部分整体偏松/偏紧判错条目分数都贴着门槛再调 industry/selection.ts 的门槛⚠️ 记住顺序先改标准再动门槛。门槛只能整体平移解决不了「哪一类判错了」的问题。每改一次跑一遍SelectBench 保留全部历史各版本可并排对比。进阶换模型对比与留出集验收换评分模型前先比一比--models 模型A,模型B在同一批样本上各跑一遍用 F1 对比和「只看模型之间有分歧的」筛选决定谁上开发集满意后跑一次留出集--split holdout留出集指标与开发集相当才说明标准真正泛化可以放心上线。速查清单事项位置分级门槛 T1 / T1_5 / T2industry/selection.ts评分标准提示词industry/prompts/selection-score.md预筛提示词industry/prompts/prefilter.md标注样本格式示例industry/gold.example.jsonl评测脚本scripts/eval-selection.tsSelectBench 导入与查询逻辑packages/backend/src/admin/selectbench.ts完整校准文档docs/selection.md整个流程就六个字标注、跑、改。标 100–200 条样本跑一次eval-selection.ts在后台 SelectBench 里看完错例再改一版标准循环几轮精选区就会长成读者真正想看的样子。【免费下载链接】AIHOT一个自己找热点、自己写日报的网站框架。把信源和精选标准换成你的它就是你的行业热点站。项目地址: https://gitcode.com/gh_mirrors/ai/AIHOT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考