Xinference:一条命令部署开源模型,vLLM/llama.cpp 通吃、OpenAI 兼容接口

Xinference

官方背景

Xinference(Xorbits Inference)是 Xorbits 团队开源的分布式模型推理框架,一条命令即可部署大语言、语音识别与多模态模型。它把 vLLM、llama.cpp、Transformers、SGLang、MLX 等推理引擎统一在 OpenAI 兼容接口之下,GitHub 星标约 9.4k。v1.0.0 是重要里程碑,此后改为双周发布节奏。

核心能力

一条命令部署:内置模型库覆盖对话、Embedding、语音、多模态,单命令即可拉起;② OpenAI 兼容 REST API(含 Function Calling)+ RPC + CLI + WebUI 多种交互;③ 多推理后端:vLLM / llama.cpp / Transformers / SGLang / MLX 可选;④ 异构硬件:GPU 与 CPU、Metal 通吃;⑤ 分布式集群部署:跨多机调度模型,充分利用集群;⑥ 与 LangChain、LlamaIndex、Dify、FastGPT、RAGFlow、Chatbox 无缝集成。

应用场景

开发者在自己显卡上跑开源模型,对外暴露 OpenAI 格式接口,现有代码几乎零改动;企业用分布式部署把多个模型调度到不同机器,弹性扩缩;RAG 平台(Dify、RAGFlow)把 Xinference 当推理底座;研究者在异构硬件上快速验证不同模型。它是「把开源模型变成可用 API」的瑞士军刀。

定价与可及性

完全开源免费(GitHub xorbitsai/inference),pip install "xinference[all]" 安装,xinference-local --host 0.0.0.0 --port 9997 启动,默认端点 localhost:9997。另有 Xinference 云与企业版可选。社区版无授权费用,自托管即可生产可用。

立即体验 Xinference →

Xinference · Xinference(Xorbits Inference)是 Xorbits 团队开源的分布式模型推…

© 版权声明
THE END
喜欢就支持一下吧
点赞85 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容