wenyi文译证据驱动全书审校AI如何带着证据逐章抓出翻译错误【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/gh_mirrors/we/wenyiwenyi文译是一款开源 AI 书籍翻译工具定位是将被语言阻隔的作品带到读者的语言中。它翻译流程中最有特色的一环是证据驱动的全书审校evidence-based review译稿完成后AI 不是看一眼就交差而是按需调取整本书的术语表、上下文和全书摘要当证据逐章核对漏译、误译与前后矛盾修复后再盲读复核。本文带你拆解 wenyi 审校引擎看看 AI 审校是怎么做到每一步都有据可查的。为什么 AI 审校要证据驱动一般的 AI 翻译工具按段落逐段翻译译完即止。作品越长越容易出这类问题同一个人名在不同章节译出两个名字代词、敬称前后跳变读者莫名其妙关键情节漏译、错译翻到后面才发现但前面早错了。根源在于模型只能看到眼前这一段无法验证自己是否与全书一致。传统做法是把译文丢给模型检查并修改但它的判断往往凭印象给不出出处你也无从验证它对不对。wenyi 的解法是给审校 AI 配上一组只读证据工具把拍脑袋审校变成证据驱动审校——下结论之前先查书、查术语表、查上下文再给判断。完整流程见 管道文档的 Quality controls。wenyi 全书审校的完整流程5 步第 1 步逐章并发初筛先标记候选问题所有章节译完后Agent Review 启动并加载最终版术语表。全书被切成连续的段落块并发检查每次响应必须带上完成回执——声明审过的段落数、且complete: true才算有效JSON 有语法损伤先本地修复缺回执时只递归拆分受影响的块重试不做无谓的全量重跑。这段回执校验逻辑在 reviewer.py#L100-L112。初筛只负责标出候选漏译、增译、误译、术语表违规、代词错误等。第 2 步证据循环——AI 主动调取证据这是最核心的一步 。候选问题会进入有界的证据循环Selective evidence loopAI 不能把整本书或整本术语表塞进提示词只能通过 4 个只读工具按需取证证据工具能查到什么glossary_term某一条术语表词条原词、译名、别名、备注term_occurrences某术语在全书中的首/中/末/第 N 处出现segment_context指定段落前后的原文译文上下文可跨章节book_context全书摘要、单章摘要、风格指南入口实现在 evidence.py#L311-L350且有三道保险查询参数有硬限制上下文前后各最多 6 段、术语长度 ≤128 字符、结果带缓存、单次响应超 64KB 直接拒收并要求缩小范围再查——模型只能小口取证吃不下整本书。最多review_agent_max_evidence_rounds轮取证后必须裁决确认、驳回或细化候选问题也可以顺手补充新发现的问题。第 3 步跨章节仲裁解决前后矛盾因为段落块是并发审的同一术语、同一代词可能被不同块提出互相冲突的统一建议。所有块结束后冲突会交给最终仲裁器 ReviewConflictArbiter它基于采样的证据给出保守建议落选方案统一改写为胜出值但所有提案都保留在轮次轨迹里可追溯仲裁全程不改术语表、不改正文失败则保守地标记为未解决。第 4 步影子修复 盲读复核确认后的问题按段落归组交给 Fixer 生成整段替换而不是 diff——它会拿到风格简报、全书摘要、章节摘要、相关术语子集和邻近原文/译文对保证改稿不跑偏文风。同一轮内所有 Fixer 读同一份不可变的影子快照补丁到轮次结束才一起生效。下一轮全书审校会对修好的影子文本盲读它收不到之前这里有什么问题的说明避免模型给自己盖章放行。循环直到连续干净通过、达到修复上限、无进展、或出现 A→B→A 反复为止。第 5 步可选 Autofix 发布修改默认情况下审校引擎是纯只读的——只产出问题与建议不动正文。加上--autofix后才会由独立的发布器把最终完整段落写入正式译文并刷新脚注与 DOCX 样式偏移。完整的前后对照链、每个问题的裁决、失败记录与写入日志都归档在autofix/index.json全程可审计。如何运行你自己的全书审校克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/we/wenyi cd wenyi uv sync配好你的 LLM API Key然后一条命令即可uv run wenyi review book.epub # 只读审校只输出问题与建议 uv run wenyi review book.epub --autofix # 审校并把确认的修复写入译文审校在一条命令翻译流程里默认开启可用--no-review跳过中断后重跑同一命令还能续跑同一轮审校。每次审校会生成一个带时间戳的运行目录state/book/targets/目标语言/reviews/review-时间戳/里面有result.json最终问题清单与折叠后的修改建议rounds/每一轮的提示词、响应与补丁便于排查autofix/index.json启用 Autofix 时的完整前后对照链。目录结构详见 使用指南的独立阶段章节。关键收获初筛只标记候选每个结论都过了证据循环才算数证据工具只读且限量防止模型吞掉整本书或越权改稿跨章冲突走仲裁落选方案不删除轨迹可回看修复先进影子区、再盲读复核正式发布是显式可选动作全程落盘在reviews/目录每条结论都能沿证据引用溯源。无论是审长篇小说还是社科专著证据驱动让 AI 的判断第一次变得可核查——这正是 wenyi 全书审校最核心的设计思想。【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/gh_mirrors/we/wenyi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考