截至2026年3月,我国日均词元调用量超过140万亿,较2024年初增长超千倍。同年5月,国家数据局将词元经济发展纳入工作体系,并于6月印发《关于推进行业高质量数据集建设行动的实施方案》,这是我国首个系统性部署行业高质量数据集建设的顶层行动纲领,为词元产业发展提供政策支撑。以词元为核心的万亿级智能经济新形态正在加速形成。

词元经济的崛起重构了AI算力的竞争逻辑。过去两年,行业深陷算力芯片军备竞赛,谁囤卡多、集群大,谁就占先机。而词元计费模式使得堆硬件的边际收益递减,效率成为新的竞争点。这一变化释放了国产AI算力生态中被长期低估的差异化空间。
当前,国内AI算力产业已告别单一架构依赖,呈现出TPU、GPU、ASIC等多条技术路线并行繁荣的局面。其中,TPU在张量计算密集场景下具有能效优势,尤其适合大规模推理与高并发词元生成类任务,正逐步成为大模型规模化落地阶段的关键算力选项。
词元经济的本质是将算力消耗转化为可计量的商业产出。芯片的价值不再由单卡峰值算力决定,而是由“单位算力能生产多少有效词元”综合衡量。中昊芯英的新一代产品“须臾”芯片的架构设计体现了这一逻辑。在2026世界人工智能大会(WAIC)期间,中昊芯英首次实物展出新一代TPU架构AI专用芯片“须臾”及泰则2.0人工智能服务器。“须臾”单芯片混合精度浮点算力达896TFLOPS,8-bit推理算力高达1792TOPS;单芯片额定功耗仅600W,相较于算力性能持平的传统芯片功耗降低50%。搭载“须臾”的泰则2.0整机能耗仅为传统GPU服务器的80%,这一能效优势直接降低了单Token的生产成本。
在架构层面,“须臾”深度优化了大模型专属张量计算逻辑,扩容寄存器与大容量片上缓存,解决了超长上下文、海量词元交互场景下的访存延迟与并行效率不足问题。通过多维张量计算单元与数据复用优化设计,有效缓解了存储墙难题,执行同等AI任务时综合计算效能可达传统GPU架构数倍。中昊芯英CEO杨龚轶凡透露,“须臾”设计目标是大幅压低单位Token成本,从一代到二代直接减半,后续迭代有望降到原有的1/10。
词元经济的落地不仅需要单芯片的能效突破,还需要集群部署与产业协同的全链条支撑。2026世界人工智能大会(WAIC)期间,中昊芯英联合杭州电信、中兴通讯宣布华东地区(杭州)首个国产TPU智算千卡集群(一期)项目落成,共部署1024片“刹那”芯片,算力规模达400P。作为中国电信体系内首个大规模部署国产TPU架构的智算集群,三方各司其职:中昊芯英提供核心算力支撑;中兴通讯提供全栈通信方案;杭州电信“息壤”算力平台将集群资源利用率从30%提升至60%以上。项目正规划二期扩容至10000P,将采用新一代“须臾”芯片进一步扩大算力规模。
大模型训推是词元生成的主要场景,集群资源利用率直接决定单位时间内的有效词元产出量。利用率从30%提升到60%以上,意味着不增加硬件投入的情况下,可交付的词元数量接近翻倍,单Token综合成本显著下降。国产TPU集群在运营商场景中跑通的是词元经济最核心的效率命题。
千卡集群落成解决了“有没有算力”的问题,而算力要真正转化为词元产能,还需要产业角色的接入与协同。在专题论坛上,中昊芯英完成了两轮签约:面向商用落地的启航合作,与杭州电信、深圳联通、第五要素等伙伴推进国产TPU在通信、金融、互联网等行业的商业化交付;聚焦生态共建的全域合作,携手联想、中兴通讯、上海闵行联合发展、成都工智院等力量,贯通算力基建、软件适配到方案研发的全链条。
两轮签约指向同一个方向——让国产TPU算力真正被用起来,在更大规模上参与词元的生产与交付。朋友圈越大,芯片越能与更多行业场景产生交集,MaaS平台的算力供给越丰富。当硬件底座就绪、产业朋友圈成形,国产TPU在词元经济中的价值闭环才真正跑通。
词元计费模式的普及,使算力规则从“卖硬件”变为“卖Token”,核心考核指标变成单Token交付成本、有效产出效率与服务稳定性。针对这一变化,国产专用算力正在一条不同于通用芯片的道路上加速奔跑——围绕词元生产效率构建端到端的综合竞争力。以TPU为代表的专用芯片路线,正在词元经济时代迎来真正的价值验证周期。
股票配资提示:文章来自网络,不代表本站观点。