排序
vLLM:UC Berkeley 开源推理引擎,PagedAttention 把吞吐拉满
官方背景 vLLM 是 UC Berkeley Sky Computing Lab 开源的大模型推理引擎,核心创新是 PagedAttention 显存管理与 Continuous Batching 连续批处理,把 GPU 利用率和吞吐打到极致。2025 年 1 月...
DeepInfra:serverless 推理 API,100+ 开源模型按 token 计费零运维
官方背景 DeepInfra 是 serverless(无服务器)推理平台,提供 100+ 开源模型的统一 API,开发者不用买卡、不用管 GPU 集群,调一个接口就能跑大模型。2026 年 5 月 4 日完成 1.07 亿美元 B 轮...
阿里刚甩出2.4万亿参数怪兽!Qwen3.8-Max上手:本地能跑、API白嫖、百万上下文一把梭
第一章 这个模型到底什么来头 8月3日,阿里一把甩出旗舰大模型Qwen3.8-Max。一句话概括它的分量:总参数2.4万亿,激活950亿,在权威三方榜单Arena里紧咬Anthropic的Claude系列,稳居全球第一梯...
RWKV:把 RNN 与 Transformer 缝合的开源 LLM 架构,线性时间常数显存
官方背景 RWKV 是一种开源的 LLM 架构,由彭博(BlinkDL)等人提出,现为 Linux Foundation AI & Data 基金会托管项目,采用 Apache 2.0 协议。它把 RNN 的线性时间 / 恒定显存与 Transformer ...
MetaGPT:把软件公司塞进一个开源多智能体框架,一句话生成完整项目
官方背景 MetaGPT 是开源的多智能体软件工程框架,由 geekan(向劲宇)等人发起,GitHub 上 5 万–6.6 万 star,采用 MIT 协议。它的核心理念是 Code = SOP(Team)——把一家软件公司的标准作业...
Cline:开源的自主编码 Agent,把 VS Code 变成会自己写代码的实习生
官方背景 Cline 是一款开源的自主编码 Agent,以 VS Code / Cursor / VSCodium 扩展形式运行,采用 MIT 协议,2023 年底发起、社区驱动。它不是一个代码补全工具,而是一个能读写文件、执行命令...
Gemma 3:Google 开放权重多模态模型,27B 跑分反超 Llama 405B
官方背景 Gemma 是 Google DeepMind 推出的开放权重模型家族,名字源自拉丁语'宝石',与 Gemini 同源(共享 Gemini 2.0 的研究与架构)。最新一代 Gemma 3 于 2026 年 3 月 12 日发布,是 Gemma...
零一万物 Yi:李开复创办的国产大模型,Yi-Lightning 每百万 token 仅 0.99 元
官方背景 零一万物(01.AI)由李开复于 2023 年创办,是国产大模型'六小虎'之一,成立 8 个月即跻身独角兽,背后有阿里、小米等支持。公司坚持开源与闭源双轨:开源 Yi-6B / 34B、Yi-1.5、Yi-VL...
Together AI:一站托管 200+ 开源大模型的 AI 原生云,推理快一半、便宜六成
官方背景 Together AI 是'AI 原生云'(AI Native Cloud),提供从推理、微调到预训练的全栈开源 AI 平台,已完成 8 亿美元 C 轮。它把 Llama、DeepSeek、Qwen、Kimi、GLM、MiniMax、Nemotron、F...
Cherry Studio:开源跨平台桌面 AI 客户端,把全网大模型聚到一个窗口
官方背景 Cherry Studio 是一款开源、跨平台的桌面 AI 客户端,支持 Windows、macOS、Linux,把市面上几乎所有大模型聚到一个窗口里。它原生接入 50+ 服务商(OpenAI、Anthropic、Google、DeepS...