
12GB 显存显卡跑 125B Qwen3.8 模型:Strata 登场,单张 RTX 5070 跑出 94 词元 / 秒
开发者开源 Strata 引擎,支持在 12GB 显存显卡上运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,单张 RTX 5070 可达 94 词元/秒。
核心要点速览
- 事件要点:开发者开源 Strata 引擎,支持在 12GB 显存显卡上运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,单张 RTX 5070 可达 94 词元/秒。
- 技术突破:围绕 Qwen, 开源, GB 等关键领域展开,推动了当前 AI 技术与工程落地的进一步深化。
- 产业观察:信息源自 IT之家,为 AI 开发者、研究人员及产业决策者提供了高价值的技术演进信号与参考。
资讯解读
Strata 引擎是一项针对大模型推理优化的开源技术,核心在于通过显存压缩与量化技术,让百亿甚至千亿参数级模型能在消费级显卡上运行。此次测试的 Qwen3.8-Flash-Next 模型为阿里 Qwen 团队推出的多模态 MoE 架构压缩版本,参数量达 1250 亿,并支持超长上下文。
该技术突破的关键在于突破了显存瓶颈。传统大模型推理需依赖昂贵的服务器级算力,而 Strata 引擎让 12GB 显存的 RTX 5070 也能流畅运行超大模型,且推理速度达到 94 词元/秒,大幅降低了本地部署的硬件门槛。
这一进展对 AI 应用普及具有重要意义。它意味着开发者与研究人员能在普通 PC 上测试和运行顶级大模型,不仅降低了研发成本,也为端侧 AI、个人智能体等应用场景提供了更广阔的想象空间。随着类似技术的成熟,大模型的本地化部署有望进一步加速。
本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。
深度背景与行业观察
随着人工智能技术的快速演化,围绕 Qwen、开源、GB、Qwen3.8 的技术探索正从单纯的算法突破转向系统化、场景化的实际落地。
在开源生态与商业化闭源模型的双重驱动下,算力调度、数据飞轮与智能体(Agent)工作流的结合愈发紧密。本条动态不仅反映了当前领域内的研发热点,也为下一阶段的工具化、工程化实践提供了重要风向标。