Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
Hacker News
是什么 · 中文摘要Strata 是一个 MIT 许可的开源本地推理引擎,宣称可在 12GB 以上显存的消费级显卡(NVIDIA RTX 20-50 系、部分 AMD 卡)上运行 125B 参数的 Qwen3.8-Flash-Next 模型,提供 Windows/Linux 一键安装、localhost 上的 OpenAI/Anthropic 兼容 API、可选图片输入与 MCP 服务。
本次关注:本次为发现该仓库(约 11.1k star、972 fork),并非模型或引擎的版本更新证据;README 中提到的引擎版本号仅作为其自述引用。
工程价值:核心思路是专家混合模型的分层放置(显存放高频专家、内存放全部专家、CPU 与 SSD 参与)加投机解码与大批量预填充,从而在单机消费硬件上跑大模型。工程上值得关注的是显存/内存/SSD 的分工与一键安装体验;但实际吞吐、显存占用、稳定性均需自行验证,README 未给出独立评测。
展开证据、指标与来源
完整摘要 · AI 解读Strata 是一个 MIT 许可的开源本地推理引擎,宣称可在 12GB 以上显存的消费级显卡(NVIDIA RTX 20-50 系、部分 AMD 卡)上运行 125B 参数的 Qwen3.8-Flash-Next 模型,提供 Windows/Linux 一键安装、localhost 上的 OpenAI/Anthropic 兼容 API、可选图片输入与 MCP 服务。
解读信息范围 · 作者/官方宣称已读取该 GitHub 仓库页面可见文本(含 README 主体、安装说明、模型选择表与故障排查),未抓取评论树、未读取 docs/ 下各文档、未查看代码与 bench 结果、未做实测。
来源证据已读取原文可见文本(可能包含导航或付费墙);未抓取评论树
推荐依据匹配关注方向:search、inference、developer、Qwen;新鲜度 0.83、同源同类型热度分位 0.89、资料完整度 1.0
解读状态AI 解读完成
- 发布时间
- 10-04 20:51(北京时间)