24GB显存跑125B模型:开源项目Strata把本地部署大模型的门槛压下来了 - *

麦站管理员 50 2026-10-05 09:20:03

内容页头部广告位(PC)
内容页头部广告位(WAP)

  一键部署OpenClaw

*10月5日消息,一个叫Strata的开源项目上了Hacker News首页,617分、289条评论,代码仓库星标约1.12万。它要做的事一句话能说完:把1250亿参数的Qwen3.8-Flash-Next跑在消费级显卡上,速度冲着每秒100个token去。

先解释这件事为什么看起来不可能、实际却成立。Qwen3.8-Flash-Next用的是混合专家架构,总参数1250亿,里面装了512个专家;但每个token只激活10个路由专家加1个共享专家,实际参与计算的约60亿参数。稀疏激活省的是算力,不是显存——下一次路由可能点到别的专家,所以所有专家都得在场待命。

Strata的办法是把整台电脑当一个存储层级用。显存放共享组件、草稿层、注意力缓存和最常用的专家;内存放完整的专家池;CPU负责计算没被缓存的专家;SSD补上大表和模型数据。专家缓存相当于一个工作集,话题变了,缓存跟着换。这也是为什么在这个负载下,显存够不够比显卡快不快更要紧。

实测数字来自社区。在RTX4090配i9-13900K和64GB DDR5的机器上,IQ2_XS档跑出106.1token/秒、IQ3_XXS档98.1token/秒,统计的是完整请求、含模型的思考过程,短对话峰值能到115和120。门槛比想象中低:12GB显存、32GB内存、约80GB磁盘就能起步。换别的卡,RTX5070是53到94,RX9070XT是44到60。

代价得说清楚。为了塞进消费级硬件,用的是2到3位的量化版本,质量损失真实存在——编程类任务多数用户认为够用,视觉和长尾任务会出现退化。拿2位量化的结果去对齐托管的前沿模型,这个比较本身不成立。另外首次启动会预占35到55GB内存,系统会卡顿一两分钟。

Strata还暴露了一个正在变化的分工。它在本机暴露OpenAI与Anthropic兼容的接口,也就是说Claude Code、Codex这类工具可以把它当本地后端用,聊天、编程、图片理解、智能体流程都留在自己机器上。本地部署的门槛压下来之后,大模型推理越来越像一道软件工程题,而不是单纯的硬件题——同一张卡,换个推理引擎,能跑的模型规模和速度就差出一个量级。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关标签
ai技术
24GB显存跑125B模型:开源项目Strata把本地部署大模型的门槛压下来了 - *
内容页头部广告位(PC)
内容页头部广告位(WAP)
上一篇:J***a 除了 Spring 还有什么? 下一篇:F-35作战半径1100公里,以色列距离伊朗首都德黑兰1600公里。以色列F-35是如何轰炸伊朗的?
相关文章
最新评论

评论记录:

未查询到任何数据!