抓取后的中医健康文章已进入 MongoDB,但业务最终依赖 Django 定义的数据结构与 MySQL 字段。问题在于,如何把采集数据稳定转成稿件,并允许必要时人工修改或补录。读完本文后,可以独立检查数据转存、去重、百度 AIP 自然语言处理、word2vec 相似推荐四个环节是否边界清晰,也能整理给 Codex 的开发任务与待验收标准。文章目录设计与需求后端设计前端设计扩展功能采集数据转稿与去重百度 AIP 自然语言处理word2vec 相似推荐Codex开发标准SOP 标准PDD 标准总结设计与需求旧稿的核心目标是“基于 NLP 的数据处理”:将抓取后存入 MongoDB 的数据,按照 Django 已定义的数据结构填充到 MySQL,实现自动上稿;同时保留手动修改与手动上稿能力。其后再对文章数据进行去重、自然语言处理,并通过 word2vec 建模生成新闻相似度排序,用于推荐列表。