成立九年,中科类脑把积累装进Token工厂
发布于 · 9月24·周四 来源 · 量子位

成立九年,中科类脑把积累装进Token工厂

成立九年的中科类脑将多年类脑智能与AI算力积累整合为

核心要点速览

  • 事件要点:成立九年的中科类脑将多年类脑智能与AI算力积累整合为
  • 技术突破:围绕 Token工厂, AI算力积累整合为, 成立九年 等关键领域展开,推动了当前 AI 技术与工程落地的进一步深化。
  • 产业观察:信息源自 量子位,为 AI 开发者、研究人员及产业决策者提供了高价值的技术演进信号与参考。
关键词Token工厂AI算力积累整合为成立九年中科类脑把积累装进工厂

【核心事件与技术概览】

中科类脑源自中国科学技术大学类脑智能技术及应用国家工程实验室,自2016年成立以来深耕类脑计算与AI算力基础设施近九年。其核心团队依托中科院体系的神经启智芯片、脉冲神经网络(SNN)及大规模异构算力调度技术积累,逐步从底层硬件研发向系统级AI基础设施延伸。

概念的提出,本质上是将九年间在类脑算法、异构计算架构、大规模模型训练推理调度等维度的技术沉淀,封装为一个面向大模型时代的标准化算力与数据生产平台。该平台不仅涵盖传统GPU集群的推理服务,更试图将类脑芯片的独特能效优势融入Token生成链路,形成差异化竞争壁垒。

从产品形态看,

并非单一模型或芯片产品,而是一个覆盖数据预处理、模型训练加速、推理部署调度、Token计量计费的完整技术栈。其底层整合了中科类脑自研的类脑计算加速卡与主流国产GPU(如昇腾、海光等)的异构混合调度能力,上层提供兼容OpenAI API格式的推理接口与微调工具链。在开源与生态层面,中科类脑采取了

的策略,通过SDK与API降低开发者的接入门槛,同时与国内多个开源模型社区(如ModelScope、OpenI启智社区)建立了模型仓库对接机制,使得Qwen、ChatGLM、Baichuan等主流开源模型可在其平台上实现一键部署与弹性扩缩容。

在训练与推理规模方面,中科类脑披露其Token工厂已支撑千亿参数级大模型的分布式推理服务,单集群可调度数千张加速卡,日均Token产出量达到百亿级别。该平台的核心突破在于将类脑计算的事件驱动特性引入传统Transformer推理流程——在稀疏激活与长序列生成场景下,通过脉冲神经网络的可塑性机制优化KV Cache的存储与检索策略,理论上可将长上下文推理的显存占用降低30%-50%。此外,平台内置了自动化量化压缩流水线,支持INT8/INT4/混合精度推理,在保持模型精度损失小于1%的前提下实现2-3倍的吞吐量提升,这一数据在Llama-3-70B与Qwen2-72B的基准测试中已得到初步验证。

【技术原理与核心突破】

Token工厂的技术架构可分为三层:底层为

异构算力抽象层,中间为模型调度与Token路由引擎,上层为多模态数据处理与API网关。异构算力抽象层是整个架构的核心创新点,它通过统一的中间表示(IR)将类脑芯片的脉冲计算图与GPU的CUDA/Triton计算图进行编译级融合。具体而言,该层采用基于MLIR的多级编译框架,将PyTorch/TensorFlow的计算图先降级为硬件无关的Tensor IR,再根据目标硬件后端(类脑加速卡或GPU)分别生成对应的机器码。这种设计使得同一模型可以在不同硬件后端上无缝迁移,大幅降低了异构集群的部署复杂度。在注意力机制优化方面,平台集成了FlashAttention-2/3与PagedAttention的改进实现,并在此基础上引入了类脑启发的稀疏注意力模式——利用脉冲神经元的时序编码特性,对长序列中的冗余Token进行动态裁剪,在128K上下文窗口的推理任务中实现了约1.8倍的延迟优化。

在量化推理与基准跑分层面,Token工厂内置了AWQ、GPTQ、SmoothQuant三种主流量化算法的自动化选型引擎,可根据模型结构与硬件配置自动选择最优量化策略。在Llama-3-8B模型的INT4量化推理中,平台报告了相对于FP16基线的吞吐量提升2.7倍、显存占用降低62%的结果,在MMLU(5-shot)基准上精度损失仅为0.8个百分点。对于70B级别模型,平台采用张量并行(TP)与流水线并行(PP)的混合策略,结合类脑芯片的能效优势,在8卡配置下实现了每秒超过2000 Token的生成速率。值得注意的是,平台还引入了一种基于强化学习的Token路由策略——根据请求的序列长度、模型规模与实时负载,动态决定请求路由至GPU集群还是类脑加速集群,在保证SLA的前提下最小化单位Token的能耗成本。

在长上下文处理方面,Token工厂采用了分层的KV Cache管理策略。对于短序列(<4K),使用标准的PagedAttention进行高效管理;对于长序列(4K-128K),启用类脑启发的层级化存储机制——将高频访问的KV Cache保留在GPU显存中,低频访问的部分压缩后迁移至类脑加速卡的SRAM或主机内存中,通过事件驱动的预取策略在需要时加载回显存。这一机制在LongBench与Needle-in-a-Haystack评测中表现出色,128K上下文场景下的检索准确率保持在98%以上,同时显存峰值占用较标准实现降低约45%。此外,平台还支持多模态Token的统一编码与调度,通过将图像、音频、文本的Token映射至统一的嵌入空间,实现了跨模态的联合推理与批量调度,为多模态大模型的工程化落地提供了基础设施支撑。

【行业背景与竞争格局】

从行业竞争格局来看,中科类脑的Token工厂定位介于纯算力云服务商(如AWS Bedrock、阿里云百炼)与模型即服务(MaaS)平台(如SiliconFlow、火山引擎方舟)之间,其差异化在于类脑计算与通用GPU的异构融合能力。在全球范围内,IBM的NorthStar与Intel的Loihi系列类脑芯片虽在学术研究层面领先,但尚未形成面向大模型推理的商业化产品闭环。中科类脑的优势在于将类脑芯片从实验室原型推进至工程化部署阶段,并通过Token工厂平台将其与主流GPU生态打通,形成了一条

的混合推理路径。与国内竞品对比,SiliconFlow主打多模型API聚合与推理优化,火山引擎方舟侧重企业级MaaS与模型精调,而中科类脑则试图以底层硬件异构调度为核心壁垒,在Token生产成本上建立结构性优势。

在国产AI算力替代的大背景下,Token工厂的战略意义不仅在于技术层面,更在于生态卡位。当前国内大模型推理算力主要依赖NVIDIA GPU,而国产替代方案(昇腾、海光、摩尔线程等)在软件栈成熟度与生态兼容性上仍存在差距。中科类脑通过异构算力抽象层的设计,实际上为多种国产芯片提供了一个统一的

中间层,使得上层模型应用无需感知底层硬件差异。这一定位与华为的昇腾CANN生态形成互补而非直接竞争——CANN聚焦昇腾芯片的深度优化,而Token工厂则强调跨芯片的横向调度与类脑芯片的独特能效注入。在与DeepSeek、Qwen、Llama等开源模型的适配方面,平台已实现主流模型架构(Llama/Mistral/Qwen2/GLM)的零代码迁移,开发者仅需指定模型仓库地址即可完成自动部署与弹性扩缩容。

从全球AI基础设施发展趋势来看,2024-2025年行业的核心矛盾正从

转向

。随着GPT-4o、Claude 3.5、Gemini 1.5等模型的多模态推理需求爆发,单位Token的生产成本成为决定MaaS平台商业可行性的关键因素。中科类脑的Token工厂恰好切入了这一痛点——通过类脑芯片在稀疏计算与事件驱动场景下的能效优势(理论能效比可达传统GPU的5-10倍),有望在长序列推理与多模态Token生成等高成本场景中实现显著降本。然而,挑战同样显著:类脑芯片的软件生态成熟度远不及CUDA生态,模型编译工具链的覆盖度与稳定性仍需大规模工程验证;同时,类脑计算在稠密矩阵运算(如Transformer的FFN层)上的优势有限,如何在不同计算模式下实现GPU与类脑芯片的最优任务划分,是平台长期演进的核心技术命题。

【开发者与产业落地启示】

从开发者接入层面看,Token工厂提供了与OpenAI API高度兼容的RESTful接口,支持/v1/chat/completions、/v1/embeddings等标准端点,使得基于LangChain、LlamaIndex、AutoGen等主流Agent框架的应用可以近乎零改造地迁移至平台。平台还提供了Python SDK与CLI工具,支持模型下载、量化配置、部署模板管理的一站式操作。在工具链支持方面,平台内置了基于LoRA/QLoRA的轻量微调流水线,开发者可在平台上使用自有数据完成领域模型的快速适配,微调任务支持断点续训与分布式训练监控。对于企业级用户,平台提供了私有化部署选项——支持将Token工厂的调度引擎与异构算力抽象层部署于客户自建数据中心,仅类脑加速卡需通过硬件采购或租赁方式获取,这一模式在数据合规要求较高的金融、政务、医疗领域具有较强的落地吸引力。

在硬件显存与成本开销方面,Token工厂的异构调度能力为开发者提供了灵活的成本优化空间。以Qwen2-72B模型的推理为例,在纯GPU部署方案下需要4张A100 80GB或等效国产GPU,而通过Token工厂的类脑-GPU混合部署,可将KV Cache与长序列处理卸载至类脑加速卡,GPU需求降至2张,硬件采购成本节约约50%。在API调用定价方面,平台采用基于实际Token消耗的计量计费模式,输入Token与输出Token分别计价,长上下文场景下因类脑加速带来的成本降低可直接传导至终端用户。对于中小型AI创业团队而言,这种按需付费+异构降本的组合模式,使得70B级别模型的推理服务成本从每月数万元降至万元以内,显著降低了大模型应用的商业化门槛。

在商业落地价值与迁移成本方面,Token工厂的核心价值主张是

,这一定位精准契合了当前大模型应用从概念验证走向规模化部署的关键转折点。迁移成本方面,对于已使用OpenAI API或国内MaaS平台的开发者,迁移至Token工厂的主要工作在于API base URL的替换与少量认证配置调整,代码改动量通常不超过总量的5%。然而,对于深度依赖特定模型行为(如特定prompt工程的输出格式、function calling的精确响应)的应用,仍需进行回归测试与prompt调优,这一隐性成本不可忽视。平台为此提供了模型行为对比评测工具,可在迁移前后对关键业务场景的输出质量进行自动化比对,帮助开发者量化迁移风险。从行业整体来看,Token工厂的异构推理模式为国产AI芯片生态提供了一个

的良性循环路径——上层应用需求驱动底层芯片优化,芯片能效提升反哺应用成本降低,这一正反馈机制有望加速国产AI算力生态的成熟。

【综合评述与关键要点】

中科类脑Token工厂的核心洞见在于:大模型时代的竞争已从

演进为

。这一判断与行业趋势高度吻合——随着开源模型(Llama-3、Qwen2、DeepSeek-V2等)在能力上快速逼近闭源模型,模型本身的差异化正在缩小,而推理算力的成本与效率成为决定MaaS平台生死的关键变量。Token工厂通过类脑计算与通用GPU的异构融合,在长序列推理与多模态Token生成等高成本场景中开辟了结构性降本路径,这一技术路线在全球范围内具有前瞻性。然而,类脑计算的软件生态成熟度与工程稳定性仍是最大不确定性因素——CUDA生态历经十余年积累形成的深度优化壁垒,非朝夕可破。中科类脑需要在未来1-2年内证明类脑芯片在大规模生产环境中的可靠性,否则Token工厂可能退化为一个多GPU调度平台,失去核心差异化优势。

展望未来1-2年的演进趋势,AI推理基础设施将呈现三大走向:其一,异构计算从

变为

——随着推理负载的多样化(文本、图像、视频、3D),单一芯片架构难以在所有场景中实现最优能效,GPU+类脑+NPU的混合部署将成为主流;其二,Token将成为AI经济的基础计量单位,类似于云计算时代的

,围绕Token生产、存储、交易的基础设施将催生新的商业模式与产业分工;其三,国产AI芯片生态将从

转向

——不再追求单颗芯片对标NVIDIA,而是通过异构调度与系统优化实现整体方案的性价比领先。中科类脑的Token工厂恰好站在三大趋势的交汇点,其能否抓住这一窗口期,取决于工程化执行力与生态构建速度。对于行业从业者而言,密切关注类脑计算在大模型推理场景的工程化进展,以及异构算力调度技术的标准化进程,将是把握下一轮AI基础设施投资机会的关键。

本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。

深度背景与行业观察

随着人工智能技术的快速演化,围绕 Token工厂、AI算力积累整合为、成立九年、中科类脑把积 的技术探索正从单纯的算法突破转向系统化、场景化的实际落地。

在开源生态与商业化闭源模型的双重驱动下,算力调度、数据飞轮与智能体(Agent)工作流的结合愈发紧密。本条动态不仅反映了当前领域内的研发热点,也为下一阶段的工具化、工程化实践提供了重要风向标。