在 Xinference 中部署 DeepSeek-V4-Pro内置模型规格、启动命令与推理引擎深度解析【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本篇文章以 Xinference 内置的 DeepSeek-V4-Pro 模型注册文档deepseek-v4-pro.rst为主体结合仓库内的模型家族元数据 llm_family.json、CLI 启动入口 cmdline.py、工具调用解析器 deepseek_v4_tool_parser.py 及其测试用例系统讲解如何在 Xinference 中一键启动这一超大规模 MoE 模型。读完本文你将掌握 DeepSeek-V4-Pro 的两种内置规格、量化选型、引擎搭配、虚拟环境依赖与函数调用Function Calling实现的完整链路。模型概览DeepSeek-V4 系列预览版包含两个强力的 Mixture-of-ExpertsMoE语言模型模型总参数量激活参数量上下文长度DeepSeek-V4-Pro1.6T1600 亿49B100 万 tokenDeepSeek-V4-Flash284B13B100 万 tokenDeepSeek-V4-Pro 在 Xinference 内置注册表中的核心元数据如下来源于 deepseek-v4-pro.rst 与 llm_family.jsonContext Length:163840Model Name:DeepSeek-V4-ProLanguages:en, zhAbilities:chat, reasoning, hybrid, tools需要留意一个细节官方模型描述宣称支持百万 token 上下文但 Xinference 内置注册表中登记的context_length为 163840见 llm_family.json即 Xinference 侧默认以 16 万 token 上下文对外提供服务这是当前模型规格与引擎层面的实际能力约束部署时需结合实际需求评估。该模型的能力标签组合为chat, reasoning, hybrid, tools意味着它同时具备chat常规对话能力reasoning深度推理能力回答前可输出思考过程hybrid混合模式可在思考/非思考模式间切换tools原生工具调用Function Calling。架构为DeepseekV4ForCausalLM停止标记配置为stop_token_ids: [1]、stop: [end▁of▁sentence]推理思考区段使用think//think标签包裹见 llm_family.json。两种模型规格Model SpecDeepSeek-V4-Pro 在 Xinference 中注册了两种模型规格分别面向 GPU 服务器与 Apple Silicon 两大硬件平台。Model Spec 1pytorch1600 亿参数Model Format:pytorchModel Size (in billions):1600Quantizations:noneEngines: vLLM, TransformersModel ID:deepseek-ai/DeepSeek-V4-ProModel Hubs: Hugging Face、ModelScope这是面向 GPU 服务器的全精度规格仅支持none不量化一种量化方式支持 vLLM 与 Transformers 两大引擎。对应的注册表片段见 llm_family.json其中同时登记了activated_size_in_billions: 49即该规格下激活参数量为 49B。启动命令如下${engine}替换为vllm或transformers${quantization}替换为nonexinference launch --model-engine ${engine} --model-name DeepSeek-V4-Pro \ --size-in-billions 1600 --model-format pytorch --quantization ${quantization}Model Spec 2mlx1600 亿参数Model Format:mlxModel Size (in billions):1600Quantizations:4bit, 8bit, bf16Engines: MLXModel ID:mlx-community/DeepSeek-V4-Pro-{quantization}Model Hubs: Hugging Face、ModelScope这是面向 Apple SiliconM 系列芯片的 MLX 规格提供4bit、8bit、bf16三种量化选择对应注册表片段见 llm_family.json。MLX 是 Apple 自家的机器学习框架能够利用统一内存架构高效运行大模型量化后显存占用大幅降低。启动命令如下${quantization}替换为4bit、8bit或bf16xinference launch --model-engine ${engine} --model-name DeepSeek-V4-Pro \ --size-in-billions 1600 --model-format mlx --quantization ${quantization}启动命令参数详解xinference launch命令由 cmdline.py 定义核心参数如下参数缩写含义--model-engine-en推理引擎如vllm、transformers、mlx--model-name-n模型名称此处为DeepSeek-V4-Pro--size-in-billions-s模型参数量级十亿此处为1600--model-format-f模型格式如pytorch、mlx--quantization-q量化方式如none、4bit、8bit、bf16--model-uid-u可选指定模型实例的 UID其中--model-engine、--size-in-billions、--model-format、--quantization的参数定义位于 cmdline.py这些参数必须与 llm_family.json 中登记的规格精确匹配否则会因找不到对应 Model Spec 而启动失败。一个实用技巧如果只想先下载模型权重而不立即启动不占用 GPU、不创建子进程、不安装虚拟环境、不将模型加载进内存可以使用 REST 端点POST /v1/cache/models详见 launch.rstcurl -X POST http://127.0.0.1:9997/v1/cache/models \ -H Content-Type: application/json \ -d { cache_uid: download-deepseek-v4-pro, model_name: DeepSeek-V4-Pro, model_type: LLM, model_engine: vllm, model_format: pytorch, model_size_in_billions: 1600, quantization: none }下载进度查询与取消使用同一个cache_uidcurl http://127.0.0.1:9997/v1/cache/models/download-deepseek-v4-pro/progress curl -X POST http://127.0.0.1:9997/v1/cache/models/download-deepseek-v4-pro/cancel推理引擎与虚拟环境依赖DeepSeek-V4-Pro 支持三种引擎Xinference 为不同引擎准备了独立的虚拟环境依赖管理见 llm_family.jsonTransformers 引擎使用#transformers_dependencies#占位符即与 Transformers 后端相关的依赖集合vLLM 引擎要求vllm0.20.1并附带#system_numpy#使用系统级 numpy这与 vLLM 高性能推理后端的需求相关MLX 引擎针对 Apple Silicon 优化。Xinference 会在首次启动某引擎时自动创建对应的模型虚拟环境隔离不同引擎之间的依赖冲突。这套机制的实现可以参考 virtual_env_manager.py 及其配套测试 test_virtual_env_manager.py。此外自 v1.8.1 起可以通过--env参数在启动时为特定模型注入运行时环境变量例如强制 vLLM 使用 V0 版本见 launch.rstxinference launch --model-engine vllm --model-name DeepSeek-V4-Pro \ --size-in-billions 1600 --model-format pytorch --quantization none \ --env VLLM_USE_V1 0混合推理与思考模式ReasoningDeepSeek-V4-Pro 具备reasoning与hybrid能力属于混合推理模型。在 Xinference 中此类模型可通过--enable-thinking在启动时开启思考模式见 launch.rstxinference launch -n DeepSeek-V4-Pro --model-engine vllm \ --size-in-billions 1600 --model-format pytorch --quantization none \ --enable-thinking开启后模型在回答前会先输出think.../think包裹的推理过程其推理标签在注册表中有明确配置llm_family.jsonXinference 会在流式输出时正确处理这些思考区段的解析与透传。工具调用Function Calling实现DeepSeek-V4-Pro 的tools能力由 Xinference 内置的专用工具解析器deepseek-v4支持实现位于 deepseek_v4_tool_parser.py注册名与模型的绑定关系见 llm_family.json。该解析器支持 DeepSeek V4 模型的两种工具调用输出格式。DSML 格式使用带全角分隔符DSML的标记语言例如DSMLtool_calls DSMLinvoke nameget_weather DSMLparameter namelocation stringtrue杭州/DSMLparameter DSMLparameter namedate stringtrue2024-01-16/DSMLparameter /DSMLinvoke /DSMLtool_callsPlain 格式不使用 DSML 前缀的纯标签格式tool_calls invoke nameget_weather parameter namelocation stringtrue杭州/parameter parameter namedate stringtrue2024-01-16/parameter /invoke /tool_calls解析器通过_detect_format自动识别当前输出采用哪种格式再构建对应的正则表达式进行解析见 deepseek_v4_tool_parser.py流式场景下则通过extract_tool_calls_streaming缓冲 token直到一个完整的invoke块出现后再一次性返回结构化参数第 138-192 行。参数值会根据stringtrue|false属性决定是保留为字符串还是用 JSON 解析为数字、布尔、数组、对象等类型。配套的单元测试 test_deepseek_v4_tool_parser.py 覆盖了 JSON 参数类型保真42→42、true→True、null→None、单次多个工具调用、纯文本透传以及流式解析等场景可作为理解该解析器行为的参考。部署实践小结在 Xinference 中部署 DeepSeek-V4-Pro可以按以下思路选型GPU 服务器选择 pytorch 规格搭配 vLLM 引擎依赖vllm0.20.1以获得高性能推理量化方式固定为none需要足够显存承载全精度权重。Apple Silicon 设备选择 mlx 规格从4bit、8bit、bf16中按显存/精度需求选择量化方式。编排集成若需在脚本中编程式启动可使用 restful_client.py 中的 Python 客户端若仅需预热权重缓存可走POST /v1/cache/models的仅下载流程。能力利用需要深度推理时加--enable-thinking开启思考模式需要 Agent 场景时模型的tools能力由deepseek-v4解析器自动接管无需额外配置。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考