
第一章 OpenAI 终于”开源”了——但这次是真的
说出来你可能不信:OpenAI 上一次正经开源,还是 2019 年的 GPT-2。
七年。整整七年,这家公司把”开放”两个字焊死在嘴上、把权重锁死在服务器里。结果 2026 年 8 月 12 日,它一口气甩出两个开源权重模型——GPT-OSS-120B 和 GPT-OSS-20B,清一色 Apache 2.0 许可。
这意味着什么?意味着你可以把他们家的”亲儿子”权重下载到自己电脑上,改、商用、二次分发,全都不用打招呼。这不是”开放 API 让你调用”,这是把模型本身塞你手里。
为什么这事值得你专门花二十分钟看这篇?因为过去你想本地跑个像样的模型,要么选 Llama,要么选 Qwen,OpenAI 的权重你碰都碰不到。现在好了,最强的那拨实验室之一,终于把门打开了。你还不赶紧进来看看?
第二章 两张卡的硬件账:你的电脑到底能不能跑
先泼盆冷水,再给颗甜枣。
GPT-OSS 用的是 MoE 混合专家架构,配合一种叫 MXFP4 的 4 比特浮点量化。正是这个量化,把显存需求砍到了离谱的程度。
小号 gpt-oss-20b:总参数 209 亿,激活才 36 亿,只要 16GB 显存就能跑。一张 RTX 4080/4090、甚至 Apple Silicon 的 Mac,直接就能上。对了,它上下文窗口是 13 万 token(131072),够你把一整本小书丢进去。
大号 gpt-oss-120b:总参数 1170 亿,激活 51 亿。MXFP4 量化后,单张 H100 80GB 就能跑;或者多卡张量并行。显存不够也别慌,官方说可以卸载到 CPU,就是慢点。
所以结论很朴实:想体验,20B 起步,你手头那台”打游戏的主机”大概率就够了;想上生产级推理,再谈 120B 和 H100。别一上来就盯着 120B,那叫眼高手低。
第三章 三条路,从”跑起来”到”能干活”
模型到手,怎么跑?我给你三条路,难度从低到高,按需取用。
- Ollama:最适合新手。一行命令装、一行命令拉、一行命令聊,还自带 OpenAI 兼容接口。
- vLLM:最适合生产。起一个本地服务,暴露标准 Chat Completions 接口,能直接接你现有的 SDK、甚至接 Agents SDK。
- Transformers:最适合折腾。几行 Python 就能调,适合写脚本、做实验、接自己的业务。
下面两章,我把前两条路的一步一动给你写清楚。第三条路给个最简样例,够你抄。
第四章 Ollama 五分钟上手(新手首选)
如果你只想先跑起来看看效果,闭眼选 Ollama。
第一步,装好 Ollama(去官网下对应系统的包,Windows / macOS / Linux 都支持)。
第二步,拉模型。终端里敲:
- 小模型:
ollama pull gpt-oss:20b - 大模型:
ollama pull gpt-oss:120b
第三步,直接开聊:
ollama run gpt-oss:20b
模型启动后,直接在终端跟它对话,中文、写代码都没问题。Ollama 会自动套上 Harmony 聊天模板,你不用管格式。
想当 API 用?Ollama 默认就开了一个 OpenAI 兼容接口,地址是 http://localhost:11434/v1。你原来的 OpenAI SDK,改个 base_url 就能连,几乎零改动。这一下,本地模型瞬间变成”免费版 GPT”。

第五章 vLLM 起一个 OpenAI 兼容服务(进阶/生产)
当你要正经用——接业务、接 Agent、要并发——就得上 vLLM 了。
装(GPT-OSS 需要带 gptoss 适配的预发行轮子):
pip install --pre vllm==0.10.1+gptoss --extra-index-url https://wheels.vllm.ai/gpt-oss/ --extra-index-url https://download.pytorch.org/whl/nightly/cu128
起服务(20B 单卡就够,120B 把 model 名换掉、显存不够就加 --tensor-parallel-size):
python -m vllm.entrypoints.openai.api_server --model openai/gpt-oss-20b --max-model-len 131072 --gpu-memory-utilization 0.92
默认跑在 8000 端口。调用就走标准接口:
POST http://localhost:8000/v1/chat/completions,body 里 model 填 openai/gpt-oss-20b,messages 正常给。你手头所有基于 OpenAI SDK 的代码,base_url 一改,立刻从”调云端”变成”调本地”。数据不出内网,按调用量零成本——老板听了都得点头。

第六章 踩坑清单——别让”开源”变”开坑”
坑我都替你踩过了,记好这五条:
- 一定要用 Harmony 聊天模板。gpt-oss 是按 harmony 格式训练的,你裸 generate 或者没套模板,它会满嘴”怪话”、不跟指令。Ollama / vLLM / Transformers 都自带模板,别手贱自己改。
- 显存不够,先退 20B。上来就冲 120B 然后 OOM 报错,纯属浪费感情。先用 20B 把流程跑通,再谈升级。
- 采样参数别乱调。官方推荐 temperature=1.0、top_p=1.0 起步。这模型是”思考型”的,温度压太低反而变傻。
- 量化只有 MXFP4 一种。目前开箱即用就这一种,别去找别的 2-bit、3-bit 权重,官方没给,跑出来是废的。
- 开源不等于没责任。Apache 2.0 让你随便用,但安全护栏得你自己做——审计、越权隔离、提示注入防御、工具沙箱,一个都不能少。别把本地模型当成”免死金牌”。
第七章 写在最后:为什么你该现在就本地跑一个
讲真,GPT-OSS 不是地球上最强的模型。它打不过同期闭源旗舰,这点我不替它吹。
但它解决了一个真问题:让你用上”属于自己”的前沿模型。
医疗、金融、法务这些碰不得云端的行业,PHI 数据不出防火墙,就能本地微调、本地推理;创业团队不想被 API 账单绑架,拿它当 Agent 底座,成本直接砍到地板;研究员想改内核、接工具、做实验,权重就在手边。
七年前 OpenAI 把门焊死,七年后它自己把钥匙递出来了。这种窗口不会一直开着——趁现在,挑张显卡,五分钟,先把那个 ollama run gpt-oss:20b 敲下去。等你会发现:原来”自己的大模型”,手感这么踏实。
暂无评论内容