排序
Ollama:一行命令在本地跑 Llama / Mistral / Qwen / DeepSeek,彻底告别云端依赖的 AI 运行时
官方背景 Ollama 是 MIT 开源的本地大语言模型运行时,由前 Apple 工程师 Jeffrey Morgan 创办,底层基于 llama.cpp 推理引擎,包装成类似 Docker 的 CLI + REST API。2025 年 7 月推出跨 macOS...
DeepInfra:serverless 推理 API,100+ 开源模型按 token 计费零运维
官方背景 DeepInfra 是 serverless(无服务器)推理平台,提供 100+ 开源模型的统一 API,开发者不用买卡、不用管 GPU 集群,调一个接口就能跑大模型。2026 年 5 月 4 日完成 1.07 亿美元 B 轮...
别再花钱调API!阿里开源Qwen3.8-27B:一块4090把旗舰大模型跑进自家电脑(三条部署路线)
第一章 一句话结论:27B 能干翻一票闭源,还免费 别再傻乎乎地花钱调 API 了。阿里 8 月 14 号晚上开源的 Qwen3.8-27B,真把'自己家门口跑旗舰大模型'这件事,变成了消费级显卡就能搞定的事。 2...
Falcon:阿联酋 TII 打造的开源开放权重大模型家族,阿拉伯语与长上下文的王者
官方背景 Falcon 是阿联酋政府背书的开放权重大模型家族,由阿布扎比先进技术研究委员会(ATRC)下属的 Technology Innovation Institute(TII)研发,目标是让前沿 AI 不受西方或中国巨头主导...
RWKV:把 RNN 与 Transformer 缝合的开源 LLM 架构,线性时间常数显存
官方背景 RWKV 是一种开源的 LLM 架构,由彭博(BlinkDL)等人提出,现为 Linux Foundation AI & Data 基金会托管项目,采用 Apache 2.0 协议。它把 RNN 的线性时间 / 恒定显存与 Transformer ...
LongCat:美团开源的 MoE 大模型家族,560B 总参却只激活 27B 的省电怪兽
官方背景 LongCat 是美团开源的 MoE(混合专家)大语言模型家族,以「高吞吐、低激活」著称。旗舰 LongCat-Flash 总参 5600 亿、每次仅激活约 270 亿;LongCat-Flash-Lite 总参 685 亿、激活仅 ...
Gemma 3:Google 开放权重多模态模型,27B 跑分反超 Llama 405B
官方背景 Gemma 是 Google DeepMind 推出的开放权重模型家族,名字源自拉丁语'宝石',与 Gemini 同源(共享 Gemini 2.0 的研究与架构)。最新一代 Gemma 3 于 2026 年 3 月 12 日发布,是 Gemma...
通义千问
通义千问(Qwen)是阿里云推出的大语言模型家族,由阿里巴巴通义实验室研发。自 2023 年 4 月发布以来,已成为全球最受欢迎的开源大模型系列之一,全球累计下载超 3 亿次,衍生模型超 10 万个,...