FriendliAI:自研连续批处理、吞吐领先 vLLM 3 倍的前沿推理云

FriendliAI

官方背景

FriendliAI 是一家总部位于首尔(另设旧金山办公室)的前沿 AI 推理云公司,其团队正是连续批处理(continuous batching)技术的发明者——这套方法如今已成为整个推理行业的标配。它基于自研 Friendli Engine 构建推理平台,面向工程师在生产环境运行开放权重与自定义模型,已通过 SOC 2 Type II 与 HIPAA 合规认证,在亚太(首尔)拥有低延迟基础设施。

核心能力

① 三条产品线覆盖不同部署:Model APIs(无服务器、按 token 计费、OpenAI API 即插即用兼容)、Dedicated Endpoints(独享 GPU、按秒计费、A100→B300)、Friendli Container(自有本地 / 私有云部署,数据完全自控);② 推理引擎宣称比 vLLM 快最高 3 倍、较闭源 API 省 50%–90% 成本;③ 支持文本、视觉、语音转写、JSON 模式、函数调用与多模态智能体工作流;④ 可一键部署 59 万+ Hugging Face 模型(含 GLM-5.2、DeepSeek-V3.2、Qwen3-235B);⑤ 提示词缓存(命中价 0.1x–0.5x)、自动扩缩容、99.99% 可用性 SLA。

应用场景

生产环境开放模型的高吞吐推理服务(尤其 GLM-5.2、DeepSeek、Qwen 等前沿开源模型)、企业 RAG 与智能体后端、对数据主权敏感的本地 / 私有云部署(Container),以及亚太地区追求低延迟的团队——首尔总部带来相比美国同行的地理延迟优势。

定价与可及性

Model APIs 按 token 计费:GLM-5.2 输入 $1.4 / 百万、输出 $4.4;DeepSeek-V3.2 输入 $0.5、输出 $1.5;Qwen3-235B 输入 $0.2、输出 $0.8;Gemma-4-31B 输入仅 $0.14。Dedicated Endpoints 按秒:A100 $2.9 / 小时、H100 $3.9、H200 $4.5、B200 $8.9、B300 $12。新用户赠 $5 免费额度,生产级团队另有最高 $1 万信用额度计划;整体为无最低消费的按量模式。

立即体验 FriendliAI →

FriendliAI · FriendliAI 是一家总部位于首尔(另设旧金山办公室)的前沿…

© 版权声明
THE END
喜欢就支持一下吧
点赞120 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容