人工智能深度学习NLP计算机视觉强化学习【免费下载链接】google-researchGoogle Research项目地址https://gitcode.com/gh_mirrors/go/google-research点击查看免费下载FinanceGym 是 Google Research 开源项目 FinanceHarness 的基准benchmark 检索环境retrieval environment部分提供点时间point-in-time金融研究评测任何 Agent 都可基于同一份 PIT 检索契约与 rubric 评分契约被评估。本文以仓库内 CONTRIBUTING.md 为核心骨架结合 FinanceGym 源码 与 docs 目录完整讲解「哪些改动在贡献范围内、如何搭建开发环境、如何通过 PR 提交代码以及如何运行基准并提交你的 Agent 报告登上排行榜」。读完本文你将掌握 FinanceGym 的模块边界、可复现的开发与评测工作流以及从一份代码补丁到一份排行榜成绩的完整链路。FinanceGym 在项目中的定位先弄清你改的是哪一半FinanceGym 是 FinanceHarness 项目刻意拆分出的benchmark environment 一半另一半是 Agent 编排器 harness不在本仓库。官方 overview 把发布物明确划分为三个 artifact且边界是承重墙Artifact是什么所在仓库模块FinanceEnv点时间搜索沙箱金融相关网页语料切片 固定模型嵌入 FAISS 索引 强制max_date截止的小型 REST APIfinancegym.env本仓库FinanceGym基准本身基于金融实体图、情景挖掘、多阶段 curation 漏斗构建的问题 rubric 集经专家标注验证financegym.questionsfinancegym.curationfinancegym.judge本仓库FinanceHarnessAgent 编排器分层工具与技能运行在 FinanceEnv FinanceGym 之上不在本仓库这一边界直接决定了 CONTRIBUTING.md 中的范围声明本仓库欢迎对数据流水线、PIT 搜索服务器、rubric judge 的贡献但 Agent 实现与训练流水线不在贡献范围内。动手前先想清楚你的改动落在哪一侧是避免 PR 被拒的第一步。贡献范围界定In scope 与 Out of scope范围内欢迎贡献语料、图、问题、curation、judge 五条流水线的 bug 修复与质量改进。对应源码即financegym/下的 corpus、graph、questions、curation、judge 五个包。PIT 搜索环境的性能与可靠性改进。即 FAISS IVF-SQ8 索引构建与financegym.env搜索服务器FastAPI/search/fetch见 pipeline.md 第 2 阶段。可复现性与文档修复。仓库把「固定模型版本、种子、token 成本预期」视为一等公民详见 reproducibility.md。新示例与 CI 改进。examples/ 已提供 4 个上手示例搜索服务器、查询 PIT 搜索、生成单个问题、评分答案新增示例非常契合这一项。范围外本仓库不接受新的 Agent 实现或 harness 变更——那是 FinanceHarness 的事改在别的仓库。训练流水线——基准构建与 Agent 训练被刻意隔离。从源码结构看这一分工还体现在pyproject.toml的依赖设计上包只声明google-genai、fastapi、pulpILP 平衡用、warcioWARC 语料解析等基准侧依赖没有任何训练框架依赖而financeharness/Agent 侧是另一个包。因此贡献者可以只安装 FinanceGym 而不触碰 Agent 栈。开发环境搭建一条命令装齐基准 搜索环境CONTRIBUTING.md 给出了官方开发设置本质上是克隆仓库 → 可编辑安装含 dev 与 faiss-cpu 可选依赖→ 静态检查三步git clone gitgithub.com:FinanceHarness/FinanceGym.git cd FinanceGym pip install -e .[dev,faiss-cpu] ruff check .结合 pyproject.toml 拆解这行安装命令-e可编辑安装便于边改边测。[dev]引入ruff0.5本项目唯一的 lint 依赖。项目在[tool.ruff]中固定line-length 100、target-version py312lint 规则集为E, F, I, B, UP, SIM并忽略 E501 交给 formatter贡献代码时请与之一致。[faiss-cpu]安装faiss-cpu1.8对应 PIT 搜索环境的索引依赖需要 GPU 加速 k-means 训练时可替换为faiss-gpu [faiss-gpu-cu121.8]。运行环境要求 Python 3.12见 pyproject 的requires-python与 setup.md。装完后用ruff check .做冒烟检查——它同时验证包能正常导入、代码格式合规这正是 CONTRIBUTING 要求每个 PR 推送前必须通过的检查。开发时的关键环境变量如果你要调试涉及 LLM 或嵌入的流水线graph、questions、curation、judge 阶段都依赖 Google GenAI请对照 setup.md 的环境变量表配置变量使用方默认值GOOGLE_API_KEY所有 Gemini 调用点必填GEMINI_MAX_ATTEMPTS/GEMINI_BASE_DELAY/GEMINI_MAX_DELAYfinancegym.common.llm6 / 2.0 / 64.0EMBED_URL/EMBED_MODEL/EMBED_DIMcorpus.extract_embedhttp://127.0.0.1:8888/v1/embeddings/Qwen/Qwen3-Embedding-4B/2560JUDGE_CALL_TIMEOUT_Sjudge.rubric_judge300硬件门槛速览涉及性能贡献时PIT 搜索环境服务于 1 亿 文档语料setup.md 记录了各阶段的资源占用索引构建需 mmap 约 1.2 TB 的embeddings.bin122M × 2560 维 × 4 字节FAISS IVF-SQ8 训练阶段峰值内存高但 GPU 可选env.server仅 1 个进程、惰性读取corpus.db与索引。若你的 PR 涉及搜索环境性能请说明在什么规模下测得的效果。Pull Request 流程三条硬性要求CONTRIBUTING.md 对 PR 的要求可以浓缩为三条一个 PR 只做一个逻辑变更Open one PR per logical change。这与仓库各阶段可独立脚本化的设计吻合——见 pipeline.md 的六个阶段每个阶段都有独立的python -m financegym.stage...入口天然适合小步提交。推送前本地运行ruff check .。lint 通过是进入评审的最低门槛。改动若触及文档化契约请在 PR 中引用docs/对应章节。这是本仓库最重要的一条docs/下存在一份被锁定的契约文档 api-contract.md锁定 API 与 JSON schema和>QUESTIONSbenchmark_400.jsonl \ ANSWERSanswers/agent.jsonl \ AGENTagent \ SCORES_OUTscores/agent.jsonl \ bash scripts/run_judge.sh该脚本逐题调用judge_pair_to_record对 rubric 的每个条目在0–4档上打分0 NOT ADDRESSED1 MENTIONED无实质2 PARTIAL方向正确但缺细节3 SUBSTANTIVE正确且具体少量缺漏4 FULLY GROUNDED正确、具体、有据可依。随后 aggregate.py 做宏平均每道题归一化为s / (4n)后取均值题目等权并用bootstrap CIseed 42、1000 次迭代给出 95% 置信区间排行榜按 Overall、Hindsightantecedent 宏平均与 Foresightconsequent 宏平均三列呈现。复现性锚点包括judge 模型可通过FINANCEGYM_MODEL覆盖、JUDGE_SYSTEM提示词固定、报告字符上限 12,000——详细清单见 reproducibility.md。写给贡献者的三条实操建议先跑通最小链路再改代码pip install -e .[dev,faiss-cpu]ruff check .之后按 examples/ 的 4 个示例从搜索服务器起步理解max_date契约后再动流水线代码。改动前确认契约边界凡涉及 API 参数、JSONL 字段、judge 分值语义的改动必须同步更新 api-contract.md 与>赞分享人工智能深度学习NLP计算机视觉强化学习【免费下载链接】google-researchGoogle Research项目地址https://gitcode.com/gh_mirrors/go/google-research点击查看免费下载相关推荐联想笔记本BIOS一键解锁终极指南简单三步释放隐藏性能联想笔记本BIOS一键解锁终极指南简单三步释放隐藏性能 还在为联想笔记本BIOS隐藏选项而烦恼想要解锁CFG LOCK安装黑苹果系统或者提升DVMT显存优固件Local Deep Research 社区基准测试结果指南从结果贡献、YAML 规范到 SimpleQA 精度解读Local Deep Research 社区基准测试结果指南从结果贡献、YAML 规范到 SimpleQA 精度解读 Local Deep ResearchAI应用人工智能大模型RAGAI Agent深度研究本地部署后端前端Mi-Freeform 高级配置教程自定义窗口尺寸、DPI 和触控采样率优化Mi Freeform 高级配置教程自定义窗口尺寸、DPI 和触控采样率优化 想要在 Android 设备上享受更灵活的多任务体验吗Mi Freeform上一篇终极指南如何在大型项目中用Flask-RESTful蓝图组织API结构下一篇终极指南如何用Obtainium解决Nova Launcher Beta更新难题实现HTML源码添加与修复创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考