MLflow Skinny 轻量级客户端解析无 SQL 存储、Server 与数据科学依赖的精简安装方案【免费下载链接】mlflowThe open source AI engineering platform for agents, LLMs, and ML models. MLflow enables teams of all sizes to debug, evaluate, monitor, and optimize production-quality AI applications while controlling costs and managing access to models and data.项目地址: https://gitcode.com/GitHub_Trending/ml/mlflow本文聚焦 MLflow 仓库中mlflow-skinny这一轻量级 Python 发行包说明它与完整版mlflow包在依赖边界、功能边界上的差异并结合仓库源码与测试验证其安装方式、可选依赖扩展与远程 Tracking 配置。读完本文你将掌握在资源受限环境边缘设备、CI、瘦客户端容器中部署 MLflow 客户端的最佳实践并理解其背后的构建机制。什么是 mlflow-skinnymlflow-skinny是 MLflow 官方提供的一个轻量级 Python 包其定位在 libs/skinny/README_SKINNY.md 中表述得很明确它是不包含SQL 存储SQL storage、Server、UI 以及数据科学data science依赖的精简 MLflow 包。也就是说它保留了 MLflow 的客户端能力与 API 骨架但去掉了运行完整平台所必需的重型组件从而显著降低安装体积与依赖冲突风险。它的核心价值在于解决一类典型问题在只需要上报实验数据、读写模型注册表的场景中不需要完整安装一套带 Web UI、带数据库迁移、带各种数据科学库的 MLflow。使用mlflow-skinny可以把依赖面压缩到最小同时保持与完整 MLflow 相同的 Python API 使用方式。与完整版 mlflow 的依赖边界从仓库的构建脚本 dev/pyproject.py 可以看出MLflow 的发行包分为多个类型SKINNY、RELEASE、DEV、TRACING其中 RELEASE 类型的完整包依赖声明为fmlflow-skinny{package_version}, fmlflow-tracing{package_version}, ] sorted(core_requirements)即完整版mlflow包本身就强制依赖mlflow-skinny与mlflow-tracing再叠加 requirements/core-requirements.yaml 中的核心组件。对比这两个依赖清单可以清晰看到完整版多出的是能力域完整版额外引入的依赖core-requirements元数据存储与迁移alembic、sqlalchemyServing 与 Web 框架flask、flask-cors、gunicorn、waitress数据科学与模型numpy、scipy、pandas、scikit-learn、skops、pyarrow、matplotlib项目执行后端docker、huey、aiohttp安全cryptography而这些正是mlflow-skinny刻意排除的。从源码结构看mlflow-skinny仅保留 RESTful 客户端所需的 Tracking / Model Registry 通信能力、Project 在本地后端与 Databricks 上的执行支持以及 Tracing 相关的基础设施依赖。mlflow-skinny 的核心依赖清单mlflow-skinny的依赖由 requirements/skinny-requirements.yaml 定义并经过构建脚本生成到 libs/skinny/pyproject.toml 中。当前版本的主要运行时依赖及版本约束如下依赖版本约束来自 pyproject.toml用途anyio3.6.2,5,!4.15.0异步支持被 server/fastapi_app 间接使用4.15.0 被排除因其破坏了 starlette WSGI 桥接click7.0,9MLflow CLI 入口cloudpickle4序列化python-dotenv0.19.0,2环境变量文件加载gitpython3.1.9,4Project 执行时 git 操作pyyaml5.1,7YAML 解析MLproject 等protobuf3.12.0,8与 MLflow 服务端通信的 proto 消息requests2.17.3,3REST 客户端packaging27版本解析importlib_metadata3.7.0,10,!4.7.0模型依赖自动探测依赖packages_distributionssqlparse0.4.0,1SQL 解析基础cachetools5.0.0,8Tracing 所需opentelemetry-api/sdk/proto1.9.0,3Tracing 基础设施NoOpTracer 自 1.9.0 引入databricks-sdk0.20.0,1Databricks 集成pydantic2.0.0,3数据校验fastapi/starlette/uvicorn1/2/1轻量 ASGI 服务能力值得注意的细节是skinny-requirements.yaml中特意注明opentelemetry-api的 1.9.0 下限是因为NoOpTracer从该版本才引入importlib_metadata的 3.7.0 下限则是因为模型依赖自动探测依赖其packages_distributions函数。这些注释体现了依赖版本约束是经过严格验证的并非随意填写。构建脚本 dev/pyproject.py 中还有一个关键校验函数_check_skinny_tracing_mismatch它强制要求tracing 的依赖必须是 skinny 依赖的子集if diff : set(tracing_reqs) - set(skinny_reqs): raise RuntimeError(Tracing requirements must be a subset of skinny requirements...)之所以做这个约束是因为mlflow-skinny不会把mlflow-tracing设为硬依赖但必须保证 tracing 所需的依赖已被 skinny 覆盖二者才能协同工作。安装 mlflow-skinny方式一从本地仓库安装如果你已经克隆了本仓库可以直接指定libs/skinny子目录进行安装参见 libs/skinny/README.mdpip install ./libs/skinny方式二从远程仓库子目录安装pip install githttps://github.com/mlflow/mlflow.git#subdirectorylibs/skinny方式三官方一键脚本从 master / 分支 / PR 安装仓库提供了 dev/install-skinny.sh使用 git sparse-checkout 只拉取构建所需的目录/mlflow、/libs/skinny、/pyproject.toml并排除mlflow/server/js前端代码避免下载整个仓库# 安装 master 最新版 curl -LsSf https://raw.githubusercontent.com/mlflow/mlflow/HEAD/dev/install-skinny.sh | sh # 安装指定分支 curl -LsSf https://raw.githubusercontent.com/mlflow/mlflow/HEAD/dev/install-skinny.sh | sh -s branch # 安装指定 PR curl -LsSf https://raw.githubusercontent.com/mlflow/mlflow/HEAD/dev/install-skinny.sh | sh -s pull/pr_num/merge安装的源码级保障symlink 与构建守卫libs/skinny/mlflow是指向仓库根目录mlflow包的符号链接symlink。仓库中的 libs/skinny/setup.py 专门为此实现了一个构建期守卫在 Windows 上若未开启开发者模式git 会把 symlink 物化为普通文本文件setuptools将找不到任何包从而构建出一个能装上、能声明mlflow命令入口、却无法 import 任何内容的空 wheel。因此 setup.py 在构建时检查if not (Path(__file__).parent / mlflow).is_dir(): raise SystemExit( libs/skinny/mlflow is not a directory, so this build would produce a wheel with no code in it.\n On Windows, git materializes symlinks as text files unless you enable Developer Mode, or clone with:\n git -c core.symlinkstrue clone https://github.com/mlflow/mlflow )也就是说在 Windows 上克隆仓库后想本地安装请使用git -c core.symlinkstrue clone ...或启用 Developer Mode。按需扩展为缺失功能补充依赖由于mlflow-skinny刻意不携带重型依赖使用其扩展功能时需按需安装相应组件。官方 README 明确给出了三类典型场景同样可在 dev/pyproject.py 的SKINNY_README模板中看到对应原文想要使用的功能需要额外安装的依赖mlflow.sklearn等 MLflow Models 组件scikit-learn、numpy、pandasSQL 元数据存储如 SQLite/MySQL/PostgreSQL 后端sqlalchemy、alembic、sqlparseServing 相关特性flask、pandas此外libs/skinny/pyproject.toml 还声明了丰富的一键可选依赖组extras安装时可以用pip install mlflow-skinny[extras]之类的形式一次性补齐extraspyarrow、boto3、botocore、google-cloud-storage、azureml-core、pysftp、kubernetes、prometheus-flask-exporter 等——覆盖 S3 / GCS / Azure / SFTP 等各云厂商制品存储与 Kubernetes 远程项目执行dbPyMySQL、psycopg2-binary、pymssql——MySQL / PostgreSQL / SQL Server 数据库驱动databricksdatabricks-agents 及云存储 SDK——Databricks 场景专用gateway/genaiboto3、slowapi、tiktoken、uvicorn[standard]、watchfiles——AI Gateway 与 GenAI 功能mcpfastmcp、click——MCP 协议支持azureazure-storage-blob、azure-identitysqlservermlflow-dbstorealiyun-ossaliyunstoreplugin阿里云 OSS 插件jfrogmlflow-jfrog-pluginkuberneteskuberneteslangchainlangchain版本范围由ml-package-versions.yml自动推导authFlask-WTF——basic auth 认证。这些 extras 与完整版mlflow包的可选依赖体系保持一致用户可以在极简客户端和全功能平台之间按需取用。远程 Tracking 配置瘦客户端的正确用法重要注意事项官方原文强调使用mlflow-skinny时由于它不包含 Server / UI / SQL 存储必须将 Tracking URI 设置为远程 MLflow 服务器而不是默认的本地文件存储export MLFLOW_TRACKING_URIhttp://your-mlflow-server:5000该环境变量在 mlflow/environment_variables.py 中有正式定义MLFLOW_TRACKING_URI _EnvironmentVariable(MLFLOW_TRACKING_URI, str, None)在代码中也可以等价地使用import mlflow mlflow.set_tracking_uri(http://your-mlflow-server:5000)在瘦客户端模式下MLflow 通过 HTTP REST 与远端 Tracking Service / Model Registry 通信因此requests是这个包的骨干依赖之一。这一架构意味着你可以在边缘节点、CI 流水线或内网受控容器中安装mlflow-skinny把数据上报到集中部署的 MLflow Server实现客户端极简、服务端集中的拓扑。源码与测试如何验证瘦客户端边界仓库的测试套件直接验证了瘦客户端的依赖边界。在 tests/test_skinny_client_omits_data_science_libs.py 中测试首先检查环境变量MLFLOW_SKINNY是否存在不存在则跳过随后断言在 import mlflow 之后flask、pandas、numpy均无法导入def test_fails_import_flask(): import mlflow # noqa: F401 with pytest.raises(ImportError, matchflask): import flask # noqa: F401这从测试层面确认了mlflow-skinny安装后不会把数据科学库连带装进来这正是它体积小的根本原因。同类测试还包括 tests/test_skinny_client_omits_sql_libs.py验证 SQL 库被省略与 tests/test_skinny_client_anthropic_import.py验证瘦客户端对可选 flavor 的延迟导入策略。此外仓库还维护了版本一致性约束RELEASE 构建会强制mlflow、mlflow-skinny、mlflow-tracing三个包版本号严格对齐mlflow-skinny{package_version}配合_check_skinny_tracing_mismatch校验保证三个子包不会出现依赖漂移。版本发布与构建机制进阶原理从 dev/pyproject.py 可以梳理出mlflow-skinny的完整构建链路依赖源头mlflow/version.py中的VERSION字符串、requirements/skinny-requirements.yaml、requirements/tracing-requirements.yaml、requirements/core-requirements.yaml、.python-version文件构建脚本对四个包类型分别组装依赖列表其中 SKINNY 类型直接使用sorted(skinny_requirements)生成物包括 libs/skinny/pyproject.tomlPEP 621 元数据与README_SKINNY.md即本文所依据的文档本体二者均标注 Autogenerated by dev/pyproject.py. Do not edit manually手工修改会被脚本覆盖发布时完整版mlflow包的 pyproject 会被 pyproject.release.toml 替换把mlflow-skinny与mlflow-tracing作为硬依赖引入实现三个包的同版本发布。因此mlflow-skinny不是一个另起炉灶的分支而是 MLflow 官方同一份源码、多种打包形态的产物——它的代码与完整版完全同源只是依赖裁剪策略不同。何时选择 mlflow-skinny综合上述分析mlflow-skinny适合以下场景边缘 / 嵌入式环境资源受限设备上需要上报实验数据但无法承受 pandas、scikit-learn 等重型依赖CI / 测试流水线只想快速验证 Tracking 客户端逻辑不必安装完整平台瘦客户端容器作为独立进程或 job 运行与集中式 MLflow Server 通过 REST 通信对体积敏感的分发场景需要把 MLflow 客户端能力打进体积敏感的分发包中。反之如果需要本地运行mlflow server、浏览 UI、使用本地 SQL 存储或本地模型 Serving则应安装完整版mlflow包它本身也会带上mlflow-skinny与mlflow-tracing无需重复安装。延伸阅读libs/skinny/README_SKINNY.md本文档本体mlflow-skinny 包的官方描述PyPI 上的 readmelibs/skinny/pyproject.tomlmlflow-skinny 的完整包元数据、依赖与可选依赖组libs/skinny/setup.pysymlink 构建守卫解释 Windows 下安装的坑requirements/skinny-requirements.yamlskinny 依赖的唯一事实来源dev/pyproject.py生成 pyproject.toml 与 README_SKINNY.md 的自动化脚本tests/test_skinny_client_omits_data_science_libs.py验证瘦客户端排除数据科学依赖的测试用例mlflow/environment_variables.pyMLFLOW_TRACKING_URI等环境变量定义。【免费下载链接】mlflowThe open source AI engineering platform for agents, LLMs, and ML models. MLflow enables teams of all sizes to debug, evaluate, monitor, and optimize production-quality AI applications while controlling costs and managing access to models and data.项目地址: https://gitcode.com/GitHub_Trending/ml/mlflow创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考