基础模型大模型人工智能DeepSeek【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1点击查看免费下载本文以 DeepSeek-R1 官方仓库为唯一事实来源系统梳理第一代推理模型 DeepSeek-R1-Zero 与 DeepSeek-R1 的训练方法论纯强化学习与冷启动 两阶段 RL/SFT管线、模型家族与权重构成、横跨数学/代码/中英文的多基准评测数据并结合仓库中的 config.json、modeling_deepseek.py 等源码文件给出 MoE 与 MLA 架构的源码级解读、基于 vLLM 与 SGLang 的本地部署命令以及保证模型按预期表现推理行为的采样参数建议。读完本文你将能够独立下载并运行 DeepSeek-R1 系列模型并为推理任务配置出稳定的生成环境。1. 模型家族概览一条从纯 RL 到冷启动再到蒸馏的技术路径DeepSeek-R1 系列是 DeepSeek 推出的第一代推理模型包含两个主模型与六个蒸馏小模型核心方法论可以用三个阶段概括。1.1 DeepSeek-R1-Zero跳过 SFT 的纯强化学习验证DeepSeek-R1-Zero 直接在大规模强化学习RL中训练基座模型不以监督微调SFT作为前置步骤。这种训练方式让模型在解决复杂问题时自主探索思维链Chain-of-Thought, CoT并自然地涌现出自我验证self-verification、反思reflection、生成超长思维链等能力。README 明确指出这是首个公开验证LLM 的推理能力可以仅通过 RL 激励、无需 SFT的研究工作为后续推理模型训练开辟了道路。当然纯 RL 路线也暴露出三个典型问题无限重复endless repetition模型可能在长 CoT 中陷入循环输出可读性差poor readability思维链结构混乱难以解析语言混杂language mixing推理过程中中英文交替出现影响连贯性。1.2 DeepSeek-R1冷启动数据 两阶段 RL/SFT 管线为解决上述问题并进一步提升推理性能DeepSeek-R1 在 RL 之前引入冷启动数据cold-start data形成两阶段强化学习与两阶段监督微调交替进行的完整管线两阶段 RL第一阶段用于发现更优的推理模式第二阶段用于对齐人类偏好两阶段 SFT分别作为模型推理能力与非推理能力的种子数据。官方评测结论是DeepSeek-R1 在数学、代码与推理任务上达到了与 OpenAI-o1 相当的水平。仓库中 README 的评测表见第 4 节提供了完整数据支撑。1.3 蒸馏小模型同样可以很强DeepSeek-R1 团队还验证了一个关键结论大模型的推理模式可以被蒸馏到小模型中且效果优于在小模型上直接通过 RL 发现的推理模式。他们使用 DeepSeek-R1 生成的推理数据微调了六个广泛使用的稠密模型基于 Qwen2.5 与 Llama3 系列开源了 1.5B、7B、8B、14B、32B、70B 六个蒸馏检查点其中DeepSeek-R1-Distill-Qwen-32B 在多项基准上超越 OpenAI-o1-mini创下稠密模型的最新最优成绩。运行 DeepSeek-R1 系列模型前请务必先阅读第 7 节的使用建议否则可能因采样参数不当而得不到预期表现。2. 模型下载权重规模、上下文长度与蒸馏基础模型2.1 DeepSeek-R1 主模型模型总参数激活参数上下文长度下载DeepSeek-R1-Zero671B37B128K HuggingFacedeepseek-ai 组织仓库DeepSeek-R1671B37B128K HuggingFacedeepseek-ai 组织仓库两个主模型均基于 DeepSeek-V3-Base 训练。关于模型架构的更多细节README 指向 DeepSeek-V3 仓库而本镜像仓库本身就携带了 DeepSeek-R1 的完整 671B 权重与推理实现可直接作为本地运行的素材。从仓库实际内容看DeepSeek-R1 权重由163 个 safetensors 分片model-00001-of-000163.safetensors至model-00163-of-000163.safetensors组成配合 model.safetensors.index.json 分片索引、config.json、tokenizer.json、tokenizer_config.json 以及模型实现 modeling_deepseek.py 与 configuration_deepseek.py 一起构成完整可加载的模型目录。2.2 DeepSeek-R1-Distill 蒸馏模型模型基础模型下载DeepSeek-R1-Distill-Qwen-1.5BQwen2.5-Math-1.5B HuggingFacedeepseek-ai 组织仓库DeepSeek-R1-Distill-Qwen-7BQwen2.5-Math-7B HuggingFacedeepseek-ai 组织仓库DeepSeek-R1-Distill-Llama-8BLlama-3.1-8B HuggingFacedeepseek-ai 组织仓库DeepSeek-R1-Distill-Qwen-14BQwen2.5-14B HuggingFacedeepseek-ai 组织仓库DeepSeek-R1-Distill-Qwen-32BQwen2.5-32B HuggingFacedeepseek-ai 组织仓库DeepSeek-R1-Distill-Llama-70BLlama-3.3-70B-Instruct HuggingFacedeepseek-ai 组织仓库蒸馏模型基于开源模型微调而来训练数据由 DeepSeek-R1 生成。README 特别提示蒸馏模型的配置与分词器相较原始基座模型略有改动请使用 DeepSeek 官方发布的设置模型卡配置运行不要直接套用基座模型的推理配置。3. 源码级架构解读从 config.json 与 modeling_deepseek.py 看 MoE 与 MLA本仓库的 config.json 声明architectures为DeepseekV3ForCausalLM、model_type为deepseek_v3说明 R1 完整继承了 DeepSeek-V3 的 MoE混合专家与 MLA多头潜在注意力架构。下面结合 configuration_deepseek.py 中DeepseekV3Config的默认值与实际生效的配置逐项拆解。3.1 主干网络规模参数配置项值含义vocab_size129280词表大小hidden_size7168隐藏层维度intermediate_size18432稠密 MLP 中间维度num_hidden_layers61Transformer 解码器层数num_attention_heads128注意力头数num_key_value_heads128KV 头数MLA 场景下头对齐num_nextn_predict_layers1额外多预测一层的数量first_k_dense_replace3前 3 层使用稠密 MLP其后替换为 MoE 层moe_layer_freq1每个 MoE 层的间隔频率每 1 层即出现一次rms_norm_eps1e-06RMSNorm 数值稳定项hidden_actsilu激活函数max_position_embeddings163840最长序列位置数配合 YaRN 缩放其中first_k_dense_replace 3与moe_layer_freq 1共同决定了网络形态浅层 3 层为稠密层其余层全部为 MoE 层这与 README 所述671B 总参数 / 37B 激活参数的稀疏激活特征完全吻合。3.2 MoE 层256 路由专家 共享专家 分组 Top-Kconfig.json中 MoE 相关参数如下配置项值含义n_routed_experts256路由专家总数n_shared_experts1共享专家数量始终激活num_experts_per_tok8每个 token 激活的路由专家数n_group8专家分组数topk_group4每组 token 仅从 4 个分组中选专家topk_methodnoaux_tc无辅助损失 专家分组的 Top-K 选择方法scoring_funcsigmoid专家打分函数norm_topk_probtrue对路由权重归一化routed_scaling_factor2.5路由专家输出缩放因子moe_intermediate_size2048单个专家的中间维度ep_size1专家并行组大小从 modeling_deepseek.py 的MoEGate.forward约 L422-L444可以看到实现细节gating 分数由sigmoid计算scoring_func sigmoid分支随后在noaux_tc模式下把 256 个专家分成 8 组每组先取组内分数 Top-2 求和得到组分数再从 8 组中选 Top-4 组最后在选中的 4 组内做专家 Top-K。这种分组 稀疏路由的设计正是 671B 总参数下每次只激活 37B 参数的关键。推理路径上DeepseekV3MoE.forward调用moe_infermodeling_deepseek.py#L534先按topk_ids统计每个专家的 token 数再对 token 按专家排序分组逐专家批量计算batch 内 token 按 expert 重排以提升访存效率并将共享专家shared_experts的输出叠加到路由结果上。3.3 MLA 注意力低秩压缩 KV长上下文的关键DeepSeek-V3 架构采用 MLAMulti-head Latent Attentionconfig.json 中相关参数为配置项值含义q_lora_rank1536Query 低秩投影维度kv_lora_rank512KV 压缩潜在维度qk_nope_head_dim128不含 RoPE 的 QK 头维度qk_rope_head_dim64含 RoPE 的 QK 头维度v_head_dim128V 头维度对应实现见DeepseekV3Attention.forwardmodeling_deepseek.py#L750Query 先经q_a_proj → q_a_layernorm → q_b_proj两级投影再按[qk_nope_head_dim, qk_rope_head_dim]切分为无 RoPE 部分与含 RoPE 部分KV 由kv_a_proj_with_mqa压缩到 512 维的潜在空间展开后经kv_b_proj还原出完整的 K、V。MLA 通过对 KV 的低秩压缩显著降低长上下文下的显存占用是 128K 上下文得以落地的核心支撑。3.4 长上下文与量化YaRN 缩放与 FP8 权重YaRN 长上下文rope_scaling声明type: yarn、factor: 40、original_max_position_embeddings: 4096、beta_fast: 32、beta_slow: 1与max_position_embeddings: 163840配合把原始 4096 长度的 RoPE 位置编码扩展至 128K 级别的实际可用上下文。对应实现为DeepseekV3YarnRotaryEmbeddingmodeling_deepseek.py#L223其中的yarn_find_correction_dim、yarn_linear_ramp_mask等函数完成维度级线性插值。FP8 量化存储quantization_config声明quant_method: fp8、fmt: e4m3、动态激活方案activation_scheme: dynamic、权重块大小[128, 128]而torch_dtype为bfloat16。分片索引model.safetensors.index.json的weight_map中大量*_scale_inv张量如q_a_proj.weight_scale_inv即是 FP8 权重的反缩放因子加载时用于反量化。3.5 加载与生成默认参数generation_config.json 预先写入了 README 推荐的核心采样参数do_sample: true、temperature: 0.6、top_p: 0.95与官方评测设置一致加载模型后可直接沿用。仓库config.json还通过auto_map将AutoConfig/AutoModelForCausalLM映射到本地 configuration_deepseek.py 与 modeling_deepseek.py配合transformers_version: 4.46.3为基于 Transformers 的加载提供了完整实现路径。4. 评测结果4.1 DeepSeek-R1 主模型评测官方统一评测设置所有模型最大生成长度设为32,768 tokens需要采样的基准使用temperature 0.6、top-p 0.95每个 query 生成64 个响应以估计 pass1。CategoryBenchmark (Metric)Claude-3.5-Sonnet-1022GPT-4o 0513DeepSeek V3OpenAI o1-miniOpenAI o1-1217DeepSeek R1Architecture--MoE--MoE# Activated Params--37B--37B# Total Params--671B--671BEnglishMMLU (Pass1)88.387.288.585.291.890.8MMLU-Redux (EM)88.988.089.186.7-92.9MMLU-Pro (EM)78.072.675.980.3-84.0DROP (3-shot F1)88.383.791.683.990.292.2IF-Eval (Prompt Strict)86.584.386.184.8-83.3GPQA-Diamond (Pass1)65.049.959.160.075.771.5SimpleQA (Correct)28.438.224.97.047.030.1FRAMES (Acc.)72.580.573.376.9-82.5AlpacaEval2.0 (LC-winrate)52.051.170.057.8-87.6ArenaHard (GPT-4-1106)85.280.485.592.0-92.3CodeLiveCodeBench (Pass1-COT)33.834.2-53.863.465.9Codeforces (Percentile)20.323.658.793.496.696.3Codeforces (Rating)7177591134182020612029SWE Verified (Resolved)50.838.842.041.648.949.2Aider-Polyglot (Acc.)45.316.049.632.961.753.3MathAIME 2024 (Pass1)16.09.339.263.679.279.8MATH-500 (Pass1)78.374.690.290.096.497.3CNMO 2024 (Pass1)13.110.843.267.6-78.8ChineseCLUEWSC (EM)85.487.990.989.9-92.8C-Eval (EM)76.776.086.568.9-91.8C-SimpleQA (Correct)55.458.768.040.3-63.7从表中可以看出DeepSeek-R1 在 MMLU-Redux、MMLU-Pro、DROP、FRAMES、AlpacaEval2.0、ArenaHard、LiveCodeBench、AIME 2024、MATH-500、CNMO 2024、CLUEWSC、C-Eval 等多项基准上取得最优或并列最优尤其在数学AIME 2024 Pass1 79.8、MATH-500 Pass1 97.3与中文任务上优势明显。4.2 蒸馏模型评测ModelAIME 2024 pass1AIME 2024 cons64MATH-500 pass1GPQA Diamond pass1LiveCodeBench pass1CodeForces ratingGPT-4o-05139.313.474.649.932.9759Claude-3.5-Sonnet-102216.026.778.365.038.9717o1-mini63.680.090.060.053.81820QwQ-32B-Preview44.060.090.654.541.91316DeepSeek-R1-Distill-Qwen-1.5B28.952.783.933.816.9954DeepSeek-R1-Distill-Qwen-7B55.583.392.849.137.61189DeepSeek-R1-Distill-Qwen-14B69.780.093.959.153.11481DeepSeek-R1-Distill-Qwen-32B72.683.394.362.157.21691DeepSeek-R1-Distill-Llama-8B50.480.089.149.039.61205DeepSeek-R1-Distill-Llama-70B70.086.794.565.257.51633蒸馏模型的结论非常直观参数量越大的蒸馏模型表现越好DeepSeek-R1-Distill-Qwen-32B 在 AIME 2024 pass1 上达到 72.6超过 o1-mini 的 63.6DeepSeek-R1-Distill-Llama-70B 在 cons64、MATH-500、GPQA Diamond、LiveCodeBench 四项上全面领先 o1-mini。5. 在线体验与 API 平台对话体验在 DeepSeek 官网聊天页面chat.deepseek.com与 DeepSeek-R1 对话并打开DeepThink开关即可启用深度思考模式观察模型的推理过程。API 接入DeepSeek 开放平台platform.deepseek.com提供OpenAI 兼容 API可无缝接入现有 OpenAI SDK 生态。6. 如何本地运行6.1 DeepSeek-R1 主模型671BREADME 指出Hugging Face 官方 Transformers 尚未直接支持 DeepSeek-R1 主模型的加载运行方式请参考 DeepSeek-V3 仓库二者架构一致均为 MoE MLA。本镜像仓库已经携带了完整的推理实现modeling_deepseek.py、configuration_deepseek.py与auto_map映射可直接将该目录视为一个标准 Transformers 模型目录使用例如from transformers import AutoModelForCausalLM, AutoTokenizer model AutoModelForCausalLM.from_pretrained( ./, # 本仓库目录auto_map 会自动加载本地 modeling_deepseek.py trust_remote_codeTrue, torch_dtypeauto, ) tokenizer AutoTokenizer.from_pretrained(./, trust_remote_codeTrue)需要特别注意的是671B 总参数模型对显存要求极高权重本身超过 600GB 量级本地单机部署需配合多卡张量并行与专家并行建议优先使用 vLLM、SGLang 等推理框架或直接使用 API。6.2 DeepSeek-R1-Distill 蒸馏模型蒸馏模型的使用方式与 Qwen、Llama 系列完全一致官方提供了两条开箱即用的部署路径。方式一vLLMvllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager--tensor-parallel-size 22 卡张量并行按显存实际情况调整--max-model-len 32768与官方评测的最大生成长度 32,768 tokens 对齐--enforce-eager禁用 CUDA Graph 以减少显存占用牺牲部分吞吐。方式二SGLangpython3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2--trust-remote-code蒸馏模型配置/分词器经过官方修改需信任远程代码--tp 22 卡张量并行。6.3 运行前提与限制说明主模型与本仓库权重面向多卡集群/数据中心级环境蒸馏模型1.5B–70B才是单机可负担的选择蒸馏模型的配置与分词器相对基座模型有改动必须使用 DeepSeek 官方发布的设置运行以当前仓库内容为准Transformers 版本需支持deepseek_v3模型类型与auto_map本地代码加载机制。7. 推理使用建议官方强制推荐README 强调使用 DeepSeek-R1 系列模型包括做基准评测时务必遵守以下配置才能达到预期性能温度设置在 0.5–0.7 之间推荐 0.6防止无限重复或输出不连贯。这与仓库 generation_config.json 中预设的temperature: 0.6完全一致不要添加 system prompt所有指令都应放入 user prompt 中数学问题建议在 prompt 中加入指令Please reason step by step, and put your final answer within \boxed{}.评测模型性能时建议多次测试并取平均推理模型具有采样随机性单次结果不足以代表真实水平。7.1 强制模型进入思考模式以think\n开头README 观察到一个现象DeepSeek-R1 系列模型在回答部分查询时会出现跳过思考模式的情况直接输出空的\think\n\n\/think这会影响模型表现。官方建议强制模型在每个输出的开头以think\n开始确保其充分推理。仓库 tokenizer_config.json 中的chat_template从实现层面印证了这一机制模板在add_generation_prompt为真时会拼接Assistantthink\n作为生成前缀——也就是说只要在调用生成接口时开启add_generation_prompt多数框架默认开启模型就会以思考标记开头用户侧同样可以在 user prompt 末尾显式要求模型先输出think。模板中还包含User、Assistant、tool▁calls▁begin等特殊 token以及/think切分逻辑将思考内容与最终答案分离可直接用于 OpenAI 兼容 API 与本地推理框架的消息组装。8. 许可证与引用本代码仓库与模型权重采用MIT License见仓库根目录 LICENSE。DeepSeek-R1 系列支持商用允许任意修改与衍生作品包括但不限于蒸馏训练其他 LLM。四个 Qwen 蒸馏模型1.5B/7B/14B/32B衍生自 Qwen2.5 系列原始基于 Apache 2.0 License并使用 DeepSeek-R1 精选的约 80 万条样本微调DeepSeek-R1-Distill-Llama-8B 衍生自 Llama-3.1-8B-Base遵循 Llama 3.1 许可DeepSeek-R1-Distill-Llama-70B 衍生自 Llama-3.3-70B-Instruct遵循 Llama 3.3 许可。引用本文所述模型时官方推荐的 BibTeX 条目为misc{deepseekai2025deepseekr1incentivizingreasoningcapability, title{DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning}, author{DeepSeek-AI}, year{2025}, eprint{2501.12948}, archivePrefix{arXiv}, primaryClass{cs.CL}, }如有疑问可在仓库提交 issue 或联系官方邮箱 servicedeepseek.com。9. 快速上手清单为便于实际落地将全文要点浓缩为一份操作清单选模型研究复现推理能力选 DeepSeek-R1671B/37B 激活/128K 上下文算力有限选 Distill 系列32B 与 70B 版本性价比最高跑服务蒸馏模型用vllm serve或sglang.launch_server--max-model-len 32768、--tp N按显存设定主模型参考 DeepSeek-V3 部署方式或使用本仓库自带的 modeling 实现配采样temperature0.6、top_p0.95仓库 generation_config.json 已预置不做系统提示指令全部放 user prompt保推理要求模型以think\n开头chat_template 在add_generation_prompt时自动完成数学题追加\boxed{}输出要求做评测每次生成 64 个响应估算 pass1多次运行取平均最大生成长度 32,768 tokens查许可MIT 协议允许商用与蒸馏衍生Qwen/Llama 蒸馏版本的最终许可需叠加基座模型条款。至此从训练方法论、架构原理、评测表现到部署命令与参数调优DeepSeek-R1 系列模型已经形成一个可复用的完整技术方案可直接用于研究复现与生产部署。赞分享基础模型大模型人工智能DeepSeek【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1点击查看免费下载相关推荐DeepSeek-R1 开源推理模型深度指南纯强化学习、蒸馏与本地部署实战DeepSeek R1 开源推理模型深度指南纯强化学习、蒸馏与本地部署实战 DeepSeek R1 是深度求索DeepSeek AI开源的 第一代推理R人工智能大模型推理模型强化学习模型评测DeepSeek终极Atom时间操作插件对比为什么scroll-through-time是最佳选择终极Atom时间操作插件对比为什么scroll through time是最佳选择 在Atom编辑器的插件生态中时间操作工具一直是开发者们关注的焦点。今天纯强化学习突破DeepSeek-R1-Zero开源推理模型训练范式重构纯强化学习突破DeepSeek R1 Zero开源推理模型训练范式重构 导语 无需监督微调纯强化学习训练的DeepSeek R1 Zero模型开源在数学基础模型大模型人工智能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考