OpenAI 七年首次开源!GPT-OSS 本地部署教程:一张显卡,把前沿大模型跑在自己电脑上

OpenAI 七年首次开源!GPT-OSS 本地部署教程:一张显卡,把前沿大模型跑在自己电脑上 封面

第一章 OpenAI 终于”开源”了——但这次是真的

说出来你可能不信:OpenAI 上一次正经开源,还是 2019 年的 GPT-2。

七年。整整七年,这家公司把”开放”两个字焊死在嘴上、把权重锁死在服务器里。结果 2026 年 8 月 12 日,它一口气甩出两个开源权重模型——GPT-OSS-120BGPT-OSS-20B,清一色 Apache 2.0 许可。

这意味着什么?意味着你可以把他们家的”亲儿子”权重下载到自己电脑上,改、商用、二次分发,全都不用打招呼。这不是”开放 API 让你调用”,这是把模型本身塞你手里。

为什么这事值得你专门花二十分钟看这篇?因为过去你想本地跑个像样的模型,要么选 Llama,要么选 Qwen,OpenAI 的权重你碰都碰不到。现在好了,最强的那拨实验室之一,终于把门打开了。你还不赶紧进来看看?

第二章 两张卡的硬件账:你的电脑到底能不能跑

先泼盆冷水,再给颗甜枣。

GPT-OSS 用的是 MoE 混合专家架构,配合一种叫 MXFP4 的 4 比特浮点量化。正是这个量化,把显存需求砍到了离谱的程度。

小号 gpt-oss-20b:总参数 209 亿,激活才 36 亿,只要 16GB 显存就能跑。一张 RTX 4080/4090、甚至 Apple Silicon 的 Mac,直接就能上。对了,它上下文窗口是 13 万 token(131072),够你把一整本小书丢进去。

大号 gpt-oss-120b:总参数 1170 亿,激活 51 亿。MXFP4 量化后,单张 H100 80GB 就能跑;或者多卡张量并行。显存不够也别慌,官方说可以卸载到 CPU,就是慢点。

所以结论很朴实:想体验,20B 起步,你手头那台”打游戏的主机”大概率就够了;想上生产级推理,再谈 120B 和 H100。别一上来就盯着 120B,那叫眼高手低。

第三章 三条路,从”跑起来”到”能干活”

模型到手,怎么跑?我给你三条路,难度从低到高,按需取用。

  • Ollama:最适合新手。一行命令装、一行命令拉、一行命令聊,还自带 OpenAI 兼容接口。
  • vLLM:最适合生产。起一个本地服务,暴露标准 Chat Completions 接口,能直接接你现有的 SDK、甚至接 Agents SDK。
  • Transformers:最适合折腾。几行 Python 就能调,适合写脚本、做实验、接自己的业务。

下面两章,我把前两条路的一步一动给你写清楚。第三条路给个最简样例,够你抄。

第四章 Ollama 五分钟上手(新手首选)

如果你只想先跑起来看看效果,闭眼选 Ollama。

第一步,装好 Ollama(去官网下对应系统的包,Windows / macOS / Linux 都支持)。

第二步,拉模型。终端里敲:

  • 小模型:ollama pull gpt-oss:20b
  • 大模型:ollama pull gpt-oss:120b

第三步,直接开聊:

ollama run gpt-oss:20b

模型启动后,直接在终端跟它对话,中文、写代码都没问题。Ollama 会自动套上 Harmony 聊天模板,你不用管格式。

想当 API 用?Ollama 默认就开了一个 OpenAI 兼容接口,地址是 http://localhost:11434/v1。你原来的 OpenAI SDK,改个 base_url 就能连,几乎零改动。这一下,本地模型瞬间变成”免费版 GPT”。

vLLM 起一个 OpenAI 兼容服务,你手头的 SDK 改个地址就能连本地模型
vLLM 起一个 OpenAI 兼容服务,你手头的 SDK 改个地址就能连本地模型

第五章 vLLM 起一个 OpenAI 兼容服务(进阶/生产)

当你要正经用——接业务、接 Agent、要并发——就得上 vLLM 了。

装(GPT-OSS 需要带 gptoss 适配的预发行轮子):

pip install --pre vllm==0.10.1+gptoss --extra-index-url https://wheels.vllm.ai/gpt-oss/ --extra-index-url https://download.pytorch.org/whl/nightly/cu128

起服务(20B 单卡就够,120B 把 model 名换掉、显存不够就加 --tensor-parallel-size):

python -m vllm.entrypoints.openai.api_server --model openai/gpt-oss-20b --max-model-len 131072 --gpu-memory-utilization 0.92

默认跑在 8000 端口。调用就走标准接口:

POST http://localhost:8000/v1/chat/completions,body 里 model 填 openai/gpt-oss-20b,messages 正常给。你手头所有基于 OpenAI SDK 的代码,base_url 一改,立刻从”调云端”变成”调本地”。数据不出内网,按调用量零成本——老板听了都得点头。

踩坑清单:Harmony 模板、显存、量化、采样参数,一个都别忽略
踩坑清单:Harmony 模板、显存、量化、采样参数,一个都别忽略

第六章 踩坑清单——别让”开源”变”开坑”

坑我都替你踩过了,记好这五条:

  • 一定要用 Harmony 聊天模板。gpt-oss 是按 harmony 格式训练的,你裸 generate 或者没套模板,它会满嘴”怪话”、不跟指令。Ollama / vLLM / Transformers 都自带模板,别手贱自己改。
  • 显存不够,先退 20B。上来就冲 120B 然后 OOM 报错,纯属浪费感情。先用 20B 把流程跑通,再谈升级。
  • 采样参数别乱调。官方推荐 temperature=1.0、top_p=1.0 起步。这模型是”思考型”的,温度压太低反而变傻。
  • 量化只有 MXFP4 一种。目前开箱即用就这一种,别去找别的 2-bit、3-bit 权重,官方没给,跑出来是废的。
  • 开源不等于没责任。Apache 2.0 让你随便用,但安全护栏得你自己做——审计、越权隔离、提示注入防御、工具沙箱,一个都不能少。别把本地模型当成”免死金牌”。

第七章 写在最后:为什么你该现在就本地跑一个

讲真,GPT-OSS 不是地球上最强的模型。它打不过同期闭源旗舰,这点我不替它吹。

但它解决了一个真问题:让你用上”属于自己”的前沿模型。

医疗、金融、法务这些碰不得云端的行业,PHI 数据不出防火墙,就能本地微调、本地推理;创业团队不想被 API 账单绑架,拿它当 Agent 底座,成本直接砍到地板;研究员想改内核、接工具、做实验,权重就在手边。

七年前 OpenAI 把门焊死,七年后它自己把钥匙递出来了。这种窗口不会一直开着——趁现在,挑张显卡,五分钟,先把那个 ollama run gpt-oss:20b 敲下去。等你会发现:原来”自己的大模型”,手感这么踏实。

© 版权声明
THE END
喜欢就支持一下吧
点赞136 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容