一张 RTX 5090 跑 2840 亿参数,每秒 24 个 token:本地 AI 推理进入可用品时代
2026-08-26
·
AI资讯
·
有封面图
一张 RTX 5090 跑 2840 亿参数的模型,每秒 24 个 token。
不是跑在云端,跑在你桌上。
一年前的参照系
2024 年,一张 RTX 4090 跑 4-bit 量化的 Llama 3 70B(700 亿参数),速度大约是每秒 2 个 token。
那时候"本地跑大模型"还是一个需要解释的概念——参数太大、本地太慢,租云卡才是正经做法。
2025 年底的 RTX 5090 用原生 mxfp4 精度,跑同样的模型,从 2 tok/s 跳到了 24 tok/s。12 倍提升,一张卡。
2840 亿参数的模型在这套配置下跑到 24 tok/s,是一个什么概念?意味着你可以用它跑代码补全、写文档、做代码审查——这些任务不需要特别长的上下文,24 tok/s 已经够用,而且响应比等云端 API 快(本地延迟低,不排队)。
这不是 GPU 的功劳,是精度格式的功劳
mxfp4 是什么?
它是 NVIDIA 的一种块浮点格式,可以简单理解为"比 4-bit 整数更聪明的压缩方式"。同样 4-bit 精度,mxfp4 比传统方法更少精度损失。
不是 GPU 架构有巨大突破,而是模型量化方法在这一年里成熟了。换句话说:**2025 年下半年开始,"本地跑大模型"从 Geek 玩具变成了可用的东西**。
这对 AI 编程工具的影响最直接。Claude Code、Codex、Gemini CLI 这些 CLI 工具,在 RTX 5090 机器上跑 284B 的模型,速度已经可以接受。不是所有任务都需要 Claude Opus 或者 GPT-5.6 Sol——对于常规的代码补全、重构、小规模测试生成,一个量化后的 284B 模型完全能跑。
意味着什么
对个人开发者来说:
- 不用再为代码补全付月费。本地跑,便宜,速度够。
- 隐私敏感的项目(公司内部代码、数据不能上云),现在有了一条本地跑的路径。
- 明年(2027)的预测是:消费级 GPU 跑前沿级推理,会变成现实。
对云端 AI API 来说:
- 这不是威胁——至少对于需要强推理、高可靠性的任务,云端还是首选。
- 但对于"补全代码"这种边界清晰的任务,本地跑的成本优势会开始侵蚀 API 的用量。
2024 年你买了一张 RTX 4090,觉得本地跑模型太慢了。2025 年你换了 RTX 5090,发现同一张卡换了量化格式之后,速度快了 12 倍。
不是硬件变了,是我们对"精度"的理解变了。
这篇文章综合 The Verge、SemiAnalysis 及 AGI Hunt(8月23日)报道。
评论区