千笔-AIWritePaper · https://www.aiwritepaper.com「模型会不会做科学」很容易停在聊天印象答对几道题、复述几段摘要。Google Research 在 ICTS 相关公开分享里强调另一条路先评测模型在真实科研工作流上的缺口再把算力花在可计分的实证软件迭代上。Nature 论文描述的 Empirical Research AssistanceERA把大模型提案与树搜索结合起来在沙箱里执行候选代码、用明确指标打分并在生物信息、流行病学预报等多个基准上报告专家级结果。本文依据公开讲座要点、Google Research 博文、Nature 文本与google-research/era仓库写成独立技术笔记不是口播搬运。图左侧评测阶梯从知识测验到可计分实证右侧 ERA 在问题定义、提案、沙箱计分、PUCT 选点间迭代。目标说明读完你应能说出科研向评测为何不能停在「高中测验式」准确率。理解「可计分科学任务」问题描述、数据、程序化指标三者缺一不可。概括 ERA / Flat UCB 树搜索生成候选、执行打分、按探索/利用选节点扩展。列出边界需要可程序化奖励、专家定题与防作弊不自动覆盖开放式纯理论。知道公开入口Nature 论文、GitHub 参考实现、Google Labs Science 相关实验工具。适用与边界适合关注要为实验室设计「模型能不能帮我写分析代码」的验收关心 Agent 科研系统如何避免只会聊天想把 Kaggle 式指标驱动流程迁移到自己的计算实验不该误读成「AI 已经替代科学家」公开材料反复强调专家在环定题、组合想法、防作弊仍关键。「任意科研问题丢进去就出论文」没有可执行评分函数时搜索缺少方向也更容易投机。「只有闭源 Gemini 能做」仓库给出算法参考同类思路在学界有其他实现关键仍是指标与沙箱。风险用错误或可作弊的奖励系统会优化到奖励而不是科学目标。讲座中提到指令遵循与防投机的改进。涉及健康、安全等领域时工具输出必须经过领域审查不能因为排行榜好看就部署。机制评测阶梯公开分享里的演进可以概括为多层表述按主题归纳细节以论文与博文为准知识与测验早期用学科问答看模型「知不知道」。长上下文与推理读全文、抽实体、聚合跨段信息、复现计算。多模态从图/表检索证据并回答评测可混合程序化检索指标与模型评审。工具与仿真例如有限元软件任务早期求解率很低反馈环变强后显著上升讲座中的数量级对比反映时代模型能力具体数字随版本变化引用时请回看原始材料。可计分实证软件给定数据与指标让系统写代码并在沙箱优化分数。关键洞察科学工作流需要领域深度、长文能力与可执行反馈。只做单次生成很难覆盖「数小时级人类专家任务」把推理算力用在多次尝试与选择上才接近 Agent 用法。机制ERA 如何工作博文与论文把 ERA 描述为在给定科学问题与成功度量时搜索文献想法、写代码、组合技术、评估结果并用树搜索在巨大方案空间里导航。参考实现说明核心是Flat UCB Tree SearchFUTSgenerate_fn根据问题与历史解让 LLM 提出新候选通常是程序。execute_fn在沙箱跑候选按问题指标返回分数。搜索按迭代扩展节点用 PUCT 类公式权衡利用高分路径与探索少访节点。输出是搜索过程中的最佳候选公开页可查看部分任务的树与代码差异。与「聊天里改提示词」的差别反馈来自真实执行分数而不是模型自我感觉。提示里可注入研究想法摘要帮助系统尝试论文级思路专家仍负责提出「试哪些想法」。报告过的应用方向包括单细胞表示学习、传染病住院预报、地球空间与神经活动预测、数值积分与零售预测等见博文与论文列表。产品侧Computational Discovery 等实验工具在 Google Labs / Gemini for Science 叙事下逐步开放需按官网申请不在此承诺可用性或价格。步骤把思路落到你自己的任务写清可计分任务输入数据路径、训练/验证约定、标量指标或可程序化校验器。准备沙箱限制网络与权限只暴露必要库记录随机种子。定义生成提示问题全文 可选研究想法要求输出可执行代码。实现打分失败崩溃、超时给明确惩罚避免静默当零却不可诊断。跑小型树搜索先少迭代验证管道再加大预算。人审最佳候选读代码差异检查是否投机泄漏标签、硬编码测试集等。归档保存树、分数曲线、最终补丁与环境锁定文件。若你只做评测不做搜索也可停在步骤 1–2用同一任务包对比不同模型的单次/多次采样成功率这已经比「感觉更聪明」有用。可验证检查清单检查项通过标准指标可用脚本对固定输出算出同一分数沙箱候选无法读写沙箱外敏感路径复现固定种子与版本后分数曲线趋势可大致重现防作弊有针对泄漏与硬编码的检查或惩罚文档能指回 Nature / 博文 / GitHub 具体段落边界文中区分「基准成绩」与「开放问题研究中」踩坑踩坑后果改法只有模糊鲁棒「好不好」搜索被评审模型带偏优先程序化指标上下文塞满聊天历史噪声大、贵只回传分数与必要错误忽视专家定题优化到无科学价值的点人指定想法与约束把排行榜第一当真理部署风险领域复核与独立复现无版本钉扎无法复述结果锁定模型与代码提交把讲座口误数字当论文引用不稳以 Nature/博文为准讲座脉络为何先评测再做 Agent分享者从医疗影像、可解释性、无障碍语音等应用背景谈到当下兴趣回到「AI 能否推动科学本身」。历史阶段被概括为为 AI 而研究科学启发用 AI 做科学预测与文献加速再到尝试让 AI 参与提出与执行计算实验。评测工作先于大胆自动化若模型连读论文抽参数、复现分析都做不稳就谈不上自主发现。材料科学例子很典型论文报告了某种模拟设定代码往往不开源。任务变成抽取材料与条件、写出调用相应库的脚本并核对数值。这要求领域知识、长上下文与推理同时在线。多模态基准则抓住「图是论文论证核心」这一现实不会读图的模型等于丢掉作者最想强调的证据。从单次调用走到 Agent核心赌注是扩展推理时计算同一问题多次生成、执行、选择。FunSearch、AlphaEvolve 等线用进化或搜索改进程序ERA 把类似思想接到数据科学与更广的实证软件。对你自己的实验室不一定要复刻整套树搜索但应问我的任务有没有标量反馈有没有安全执行环境没有这两者所谓科研 Agent 多半仍是聊天。应用故事预报、径流、二氧化碳、零售等说明「专家出题 系统搜代码」可以打到公开榜前列同时博文也提醒投机与指令遵循问题。把这些读成「可复现实验管道的胜利」比读成「模型有自我意识」更有工程价值。给你的评测委员会的一页纸如果实验室要决定「是否引入某科研 Agent」开会前先填目标任务能否写成程序化指标不能则只做辅助起草不做自动搜索。数据能否进沙箱涉及隐私则先合成或脱敏。成功标准是公开榜、内部历史最佳还是物理一致性检查谁有权批准把某候选代码合并进正式分析库失败时如何回滚是否保留每次树搜索的完整日志五问有空就不要采购口号。ERA 类系统的公开成绩证明的是在可计分设定下搜索式写代码能达到很强水平它没有证明「无需指标的科学发现已被解决」。把这句话写进纪要能避免预算会议跑偏。参考实现仓库适合做教学与小规模复现真实科学问题仍要自备数据、指标与领域审查。Google Labs 上的实验产品面向申请制可用性随时间变化写作时请以官网为准不在正文承诺「人人可立即免费无限用」。总结评科研 LLM/Agent应沿着「知识 → 长文与推理 → 多模态与工具 → 可计分实证」加严。ERA 展示了一种把推理算力变成树搜索写软件的路径有指标、有沙箱、有探索利用才有机会逼近专家级实证代码。它加速的是可验证的计算实验迭代不是自动颁发科学结论。材料入口YouTubeF-bF_YLXg9g、Google Research 博文、Nature 论文、github.com/google-research/era、labs.google/science。