Groq:用自研 LPU 芯片把开源大模型跑出 20 倍速度的极速推理云

Groq

官方背景

Groq 是一家专注 AI 推理的芯片公司,2016 年由前 Google TPU 核心架构师 Jonathan Ross 创立,总部位于硅谷。它不训练模型,而是自研了一颗名为 LPU(Language Processing Unit,语言处理单元) 的专用推理芯片——靠片上 SRAM 与大带宽把 transformer 推理做到极致,目前已服务全球 300 万+ 开发者。

核心能力

极致速度:Llama 3.3 70B 稳定约 394 token/秒、小模型轻松破 1,000 token/秒,比同权重 GPU 云快 5–20 倍,首字延迟低于 100ms;② OpenAI 兼容 API,改一行 base_url 即可迁移;③ 运行 Llama 4 / Qwen3 / GPT-OSS / DeepSeek / Gemma / Whisper 等开源权重;④ 提示词缓存(5 折)、Batch API(5 折)、内置联网搜索、工具调用与结构化输出。

应用场景

实时语音 AI、流式对话、交互式编程助手等对延迟极度敏感的场景;需要把开源模型低延迟上线的 Agent 与边缘应用;不想被 GPU 队列拖累、追求”秒回”体验的产品。注意:Groq 只跑开源权重,不含 GPT/Claude/Gemini 等闭源前沿模型。

定价与可及性

真正的免费层(限速、无需信用卡);按 token 计费、无月费:Llama 3.1 8B 输入 $0.05 / 输出 $0.08 每百万 token,Llama 3.3 70B $0.59 / $0.79,Llama 4 Scout $0.11 / $0.34,Qwen3 32B $0.29 / $0.59;Whisper 转录约 $0.04/小时。Batch 与缓存各 5 折可叠加。2025 年底获英伟达 200 亿美元授权合作,GroqCloud 仍独立运营。

立即体验 Groq →

Groq · Groq 是一家专注 AI 推理的芯片公司,2016 年由前 Go…

© 版权声明
THE END
喜欢就支持一下吧
点赞80 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容