UltraX-Preview实战指南用20B精炼Token从零预训练MiniCPM模型的完整教程【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewUltraX-Preview 是 OpenBMB 开源的大模型预训练数据精炼数据集合集包含 5 个经 UltraX 函数调用式精炼的英文预训练语料每个约 20B tokens专为从零预训练 MiniCPM 等轻量级 LLM 设计帮助新手以更低的数据成本获得更强的模型效果。 一、UltraX-Preview 是什么五大 20B 精炼语料一次看懂传统预训练语料往往重数量、轻质量——错误页面、导航残留、登录墙文本混杂其中白白消耗训练算力。UltraX-Preview用 UltraX 精炼框架对 5 个主流英文语料逐条做了外科手术式编辑产出 5 份各约 20B tokens 的高密度预训练语料是 LLM 预训练语料筛选与数据精炼方向上值得关注的开源成果。精炼语料源语料特点UltraX-FineWebFineWeb大规模 Common Crawl 网页语料UltraX-RedPajama-V2RedPajama-v2多源网页语料UltraX-AICCAICCHTML 解析的高保真网页语料UltraX-Ultra-FineWebUltra-FineWeb质量过滤后的 FineWeb 语料UltraX-FineWeb-ProX-DocFineWeb-ProX-Doc文档级精炼语料数据以分片 parquet 文件组织统一存放在 data/ 目录下例如 data/UltraX-FineWeb/ 共 104 个分片data/UltraX-AICC/ 共 61 个分片。⚙️ 二、核心原理函数调用式精炼如何提升预训练数据质量与规则清洗或端到端 LLM 改写不同UltraX 训练一个轻量精炼模型来预测结构化编辑操作再在原始文本上确定性执行——每条样本独立精炼既保留原文信息又精准去除噪音。函数空间一览5 种编辑操作编辑操作作用keep_all()文档无需修改原样保留remove_all()整篇无价值错误页、登录墙整体删除remove_lines(start, end)删除指定行区间replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置附近插入新行底层由LAM行级对齐 DCR动态上下文替换流水线支撑先把原始文本与精炼文本在行级别对齐再把字符级编辑转化为带唯一上下文锚定的replace_str操作配合滑动窗口推理、重叠感知聚合与歧义过滤确保亿级样本规模下执行可靠。完整技术细节可参考 README_ZH.md 的亮点章节。 三、快速上手3 步获取 UltraX 精炼数据集第一步克隆数据仓库git clone https://gitcode.com/OpenBMB/UltraX-Preview第二步看懂 5 列数据格式每个 parquet 文件结构统一预训练时重点关注cleaned_content列列名说明uid唯一标识符raw_content 的 MD5 哈希raw_content精炼前的原始文本cleaned_content经 UltraX 精炼后的文本✅ 预训练用这一列processed_functions实际执行的编辑操作记录source源语料名称第三步加载数据集from datasets import load_dataset # 以 UltraX-FineWeb 为例 ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain)其余 4 个配置将参数替换为UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc即可完整示例见 README.md 的 Quick Start 部分。 四、实战用 20B Token 从零预训练 MiniCPM 模型官方实验设置模型1B 参数的 MiniCPM从零预训练数据单一精炼语料的 20B tokens评估LightEval 零样本设置10 个基准ARC-C、ARC-E、CSQA、HellaSwag、MMLU、OBQA、PIQA、SIQA、WinoGrande、SciQ精炼数据到底带来多少提升UltraX 在全部 5 个语料上取得最高平均性能在 50 个任务-语料组合中拿下 34 个最佳结果 相比原始数据Raw平均相对提升约2.00%相比 ProX-C 提升约1.53%数据效率更优在 FineWeb 上UltraX 仅用 16B tokens45.49就超过了 Raw 和 ProX-C 用满 20B tokens 的最终成绩45.08 / 45.05——同样的算力预算更早到达目标性能这意味着用 UltraX-Preview 训练 MiniCPM可以少喂约 20% 的 token 达到同等效果对算力有限的新手尤其友好。 五、新手怎么选预训练语料一份实用清单你的需求推荐语料通用预训练、最标准的起点UltraX-FineWeb追求更干净的文本质量UltraX-Ultra-FineWeb希望来源更丰富多样UltraX-RedPajama-V2重视 HTML 解析保真度UltraX-AICC偏向文档级长文本结构UltraX-FineWeb-ProX-Doc建议先用一个语料跑通完整预训练 评估流程再横向对比不同语料这样能直观感受数据精炼带来的差异。 六、许可证与使用注意事项本项目基于 Apache 2.0 协议发布详见 LICENSEUltraX 语料由多个源语料构建商用前请逐一对比各源数据集的许可证项目明确禁止未经授权的镜像、转载与商业化包装再发布✅ 总结UltraX-Preview 提供了一条精炼语料 → 20B Token → 从零预训练 MiniCPM的完整可复现路径5 大语料开箱即用5 列格式清晰易读官方实验证明精炼数据在平均性能与数据效率上双双占优。对于想要低成本体验 LLM 预训练全流程的新手这是一份值得收藏的中文预训练数据资源。关键文件索引中文文档README_ZH.md 英文文档README.md数据目录data/UltraX-FineWeb/、data/UltraX-RedPajama-V2/、data/UltraX-AICC/、data/UltraX-Ultra-FineWeb/、data/UltraX-FineWeb-ProX-Doc/许可证LICENSE【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考