中昊芯英发布第二代TPU芯片“须臾”,落地华东首个国产千卡智算集群

撰文 | 雁 秋
编辑 | 李信马
题图 | 中昊芯英
在WAIC 2026期间,中昊芯英宣布两项重要进展:
其一,第二代自研TPU架构AI芯片“须臾”正式亮相,实测混合精度算力达896TFLOPS,在同等性能下功耗较传统GPU方案降低约50%。

其二,由中昊芯英联合杭州电信、中兴通讯共建的华东地区(杭州)首个国产TPU千卡智算集群正式投入运行。业内评价称,此举标志着国产专用算力从技术验证迈向规模化商用新阶段。

华东地区(杭州)首个国产TPU千卡智算集群现场
作为国内少数掌握高性能TPU架构AI专用芯片全栈技术的企业,中昊芯英坚持八年专注TPU路线,产品序列从初代“刹那”迭代至新一代“须臾”,展现了中国AI算力在通用GPU之外的自主演进路径。
“须臾”相较初代性能提升3倍,功耗未显著增加;其国产化率如何?能否支撑大模型高效落地?在Token经济加速渗透背景下,公司如何平衡投入与回报?SmartHey在WAIC 2026现场对话中昊芯英创始人兼CEO杨龚轶凡,以及中兴通讯、中国电信相关负责人,深入探讨国产算力的现实突围与长期逻辑。
01、八年,聚焦TPU架构攻坚
GPU诞生于图形渲染需求,其单卡独立、弱互联的设计初衷,并非为大规模深度学习而生。当Transformer成为AGI主流架构时,中昊芯英在2018年即判断:面向海量神经网络并行计算的专用TPU架构,才是更适配未来AI发展的底层路径。
创始人杨龚轶凡指出:“GPU巨头已深耕三十年,弯道超车难度极大;而TPU从设计之初就锚定张量运算与分布式训练场景,硬件资源可全部向计算、通信与数据搬运倾斜,算力密度和能效比天然占优。”
实践印证了这一判断:TPU脉动阵列集成度更高,同等算力下功耗约为对标GPU产品的70%;该优势在千卡级集群中呈指数级放大。杭州电信智算及IDC中心总经理王良表示:“TPU在推理任务中展现出更强的吞吐稳定性与调度灵活性。”
八年前被视为“非主流”的选择,如今已成现实——全球算力市场中,GPU份额已回落至约50%,TPU架构占据另一半关键阵地。

02、100%自研指令集,软件栈进入攻坚期
2023年,“刹那”实现国内首颗高性能TPU AI芯片流片量产;2026年,“须臾”基于规模化落地经验完成升级,性能提升3倍,功耗控制优异。
关于国产化程度,杨龚轶凡明确回应:“算子层、指令集、核心IP、计算平台全部100%自研,未采购任何第三方数字IP授权。”指令集作为芯片“语言”,其自主可控意味着技术演进权与长期成本主导权牢牢掌握在企业手中。
但硬件自主只是起点,软件栈成熟度才是“好用”的关键。目前,智谱、DeepSeek等主流国产大模型均可在中昊芯英TPU上当日适配;后续通过2–4周专项调优,可将算力利用率与Token吞吐性价比推向最优。
为加速商业化落地,中昊芯英推出“Token Factory”模式——以标准化API服务交付算力,客户仅需关注百万Token成本与时效。“用户不关心底层框架,只关心结果是否可靠、成本是否可控。”该模式既规避了早期生态不完善的风险,又持续反哺软件栈迭代。

03、Token经济下的“限流”智慧
当Agent应用爆发,输入Token规模远超输出(最高达万倍级),算力调度范式迎来变革:Prefill-Decode(PD)分离成为刚需。TPU原生支持PD调度,相较需兼顾多场景的GPU,部署门槛更低、效率更高。
然而Token经济也带来新挑战。正如《企业想用AI赚钱,得先挺过“奇点”前夜》所指出:奇点前,单Token成本下降,但总用量激增导致整体投入攀升,“越用越便宜、越用花越多”成为普遍困境。
杨龚轶凡坦言:“我们已在内部主动限制Token使用——消耗已远超业务合理阈值。”他观察到,一线员工对大模型价值的认可,正体现为自发的使用克制:“单个研发效率提升5–10倍,但组织级效能尚未同步跃升。这个‘滞后’正是当前Token经济最真实的成长阵痛。”
当企业开始理性“限流”,说明价值共识已然形成;下一阶段的核心命题,是重构组织流程与协作方式,让系统性效率真正匹配个体能力跃迁。唯有此时,Token经济才能从粗放扩张转向精益运营,在奇点处完成价值交汇。
写在最后
“须臾”不仅是一颗芯片,更是国产算力演进的关键锚点。它用100%自研的底层架构与千卡级真实集群验证了一条路径:在AI时代,真正的超车不在速度追赶,而在架构定义权的争夺与落地闭环的构建。
