【导语:摩尔线程的报告 也是预告】

在高科技领域,中国唯二还与世界最高水平有较大差距的,一个是光刻机,另一个就是GPU芯片,而这两者正是AI之争的关键基石。

幸运的是,在“算力即国力”的号召下,国产GPU芯片近年来呈现出井喷之势,众多品牌纷纷拿出丰富、强大的产品矩阵,展现了不俗的实力。

在这其中,成立仅仅5年的摩尔线程,无疑是关注度最高的品牌。

一方面,摩尔线程创始人张建中曾担任NVIDIA全球副总裁、中国区总经理,自带光环。

另一方面,摩尔线程的MTT S80,至今仍是唯一能够在公开渠道买到的国产游戏显卡,而且每月都在更新驱动。

5年来,摩尔线程基于自研的全功能GPU芯片,发展出了软硬兼备的全线产品堆栈,覆盖几乎所有GPU相关领域。

从大家最熟悉的游戏显卡(S80/S70)到专业视觉加速显卡(X300/S50)、数字办公显卡(S30/S10);

从算力本(AIBOOK)到台式机(智娱摩方);

从算力加速卡(S5000/S4000)到服务器(MCCX D800 X1/X2)、智算中心(夸娥集群);

从基础软件、AI套件到云原生软件、图形与多媒体软件;

从AI模型(MUSAChat)到AI应用(魔笔马良/魔笔天书)……

所有这些,摩尔线程都已涉足,而且都干得有声有色,在众多传统与新兴领域都可以看到摩尔线程活跃的身影!

随着IPO上市成功,关注摩尔线程的已经不仅仅是科技行业,而是得到了全民瞩目。

所以,摩尔线程是时候做一次总体汇报,也是时候展望一下未来了!

这就是摩尔线程的第一届MUSA开发者大会,可以说这次大会干货之丰富,恐怕超出了每一位与会者的意料与期待!

大会上,我们看到了一个新的GPU架构、三个新的GPU芯片、一个新的算力集群、两个新的整机,还有众多开发工具和生态上的升级,让人应接不暇。

进入正题之前,先解释两个关键名词。

一是“全功能GPU”(Universal GPU),指具备功能完备性与精度完整性的GPU,通俗地讲就是一个GPU架构可以干几乎所有的活儿。

其中,功能完备性体现在单一GPU芯片中集成AI计算加速、图形渲染、物理仿真和科学计算、超高清视频编解码等多种引擎,可以满足不同的图形与计算需求。

精度完整性体现在单一芯片支持FP64、FP32、TF32、FP16、BF16、FP8、INT8、FP6、INT4、FP4等不同计算精度,可以满足不同的GPU加速计算需求。

相比于TPU、VPU、GPGPU、NPU、ASIC等功能相对单一的图形或计算芯片,全功能GPU自然更加能打,来什么活儿都能干。

二是“MUSA”,英文全称Meta-computing Unified System Architecture,中文名“元计算统一系统架构”,摩尔线程自主研发,是覆盖芯片硬件架构、指令集、编程模型、软件运行库、驱动程序框架等的全栈技术体系。

MUSA架构可以说是全功能GPU的基础,使之具备更强的计算通用性、更优的技术演进能力、更佳的生态兼容性、更广泛的市场适应性。

这一次,MUSA不仅带来了硬件架构迭代,也迎来了全栈软件升级,包括支持新的MUSA C、TilLang、FlagOS & Triton编程模型,深度优化了性能,比如计算效率可达98%、通信效率可达97%、编译器性能提升3倍、高性能算子库等,以及更广泛的计算加速库、通信、管理开源。

新架构×1、新芯片×3、新整机×2、新集群×1:5岁的摩尔线程彻底爆发了!

【主权AI的三大支柱:成败就看它了】

大会伊始,中国工程院院士、清华大学计算机系教授郑纬民发表了一番发人深思的演讲。

郑纬民院士首先提出了主权AI的三大支柱:算力自主、算法自强、生态自立,三者互为前提,互相约束,共同构成主权AI的系统工程框架。

其中,真正决定主权AI成败的,在于是否有足够多的开发者,愿意长期在一套堆栈上为一款GPU写代码,因为开发者才是生态的核心,并不是厂家。

所以,国产平台最需要解决的问题,就是降低迁移成本、提高工具链成熟度、做好社区尤其是开源社区,这样才能从实现“能用”到“好用”再到“愿意用”的逐步跨越。

郑院士对摩尔线程可以说是赞不绝口。

一是摩尔线程的国产全功能GPU,一颗芯片就能同时做好3D图形渲染、HPC高性能计算、AI加速,这是非常不容易的。

二是摩尔线程MUSA就是类似于CUDA生态的国产实践,也非常重视开源。

郑院士所在的清华大学团队做了两件事,一个是做了Mooncake,是在推理中以KVCache为中心的大模型推理架构,能节省很多硬件资源,而且是开源的。

第二个例子是KTransformers,通过基于计算强度的Offload策略,可以混合使用多个CPU、GPU,将大模型中的不同负载分配给不同设备,首次将千亿模型本地化的成本降到了十万元级别。

郑院士最后提出,国内GPU行业目前面临严重的内卷、碎片化问题,形成了巨大的阻碍。

所以产业联盟与软硬件协同设计非常重要,产业界要团结起来,应用也要团结起来,一起努力解决这个问题。

只有当国产AI加速卡在真实业务中大规模使用,生态才会具备自我强化的正反馈,形成正向闭环。

【新一代GPU架构:花港】

摩尔线程创始人、董事长兼CEO张建中做主题演讲,在三个小时的时间里带来了一个又一个惊喜!

2022年以来,摩尔线程MUSA GPU架构每年迭代一次,已经先后诞生了苏堤、春晓、曲院、平湖——是的,摩尔线程的架构代号都来自“西湖十景”。

本次公布的新架构,代号为“花港”。

“花港”架构支持新一代指令集,算力密度提升50%,能效更是提升多达10倍。

它支持FP4到FP64的全精度端到端加速计算,包括新增支持MTFP6、MTFP4,以及专门优化了FP8、FP6、FP4三种低精度计算,支持混合计算,能效更高。

它具备第一代AI生成式渲染架构(AGR),利用AI能力改造传统流水线,渲染效率更高,第二代光追硬件加速引擎,生成速度比上代提升5-6倍,可以完美支持最新的DX12 Ultimate的所有功能。

另外,它还支持新一代异步编程技术,优化任务调度与并行机制,再结合自研MTLink高速互联技术,可以支持10万卡及以上的超大规模智算集群。

未来,摩尔线程将基于“花港”架构,推出高性能AI训推一体的“华山”芯片,以及专攻高性能图形渲染的“庐山”芯片。

作为国产GPU架构,除了良好的性能,安全上自主可控更是至关重要。

“花港”架构具备全栈自研与自主可控的核心能力,通过安全域、信任域、保护域、功能域四层硬件安全架构,提供从芯片到系统的可验证安全守护。

具体包括:硬件信任根HRoT、安全启动、固件安全更新与保护、可信执行环境、硬件加解密加速引擎、国密算法、机密计算、DRM数字版权保护、生命周期管理,等等。

摩尔线程的GPU架构基于全栈自主研发,拥有扎实的专利壁垒,截至2025年6月30日,累计已申请专利1000多项,获得授权专利514项,其中发明专利468项。

这,正是摩尔线程最大的底气。

【十万卡集群的基础:AI训推一体芯片“华山”】

“华山”芯片基于花港架构而来,是一款专门面向AI训练与推理一体化的加速计算产品,可以支撑万卡级智算集群,构建下一代“AI工厂”。

按照官方说法,它的性能上已经全面超越NVIDIA上一代Hopper架构(图中Hxxx),并且能与NVIDIA新一代Blackwell架构(图中Bxxx)打得有来有回。

“华山”最突出的特性就是支持新一代异步编程技术,可以充分发挥每一个核心的算力。

该技术可以利用各种不同线程的同步效应,将负载任务自动、平衡地分配到每一个计算单元,确保它们都能始终高效率工作,不至于部分单元累死、部分单元空闲。

为此摩尔线程做了大量的工作,包括设计各种不同的调度机制等,从而让开发者可以无感去操作芯片,不用操心具体的负载分配细节。

“华山”还集成了新一代高性能Tensor张量计算系统。

首先是支持全精度,从32位到4位各种整数、浮点、张量数据格式都支持,尤其是大幅提升了FP6、FP4张量运算的性能,支持MTFP8/6/4混合精度计算。

新增TCE-PAIR模式,可以让两个TCE单元彼此共享同样的数据,增强内部数据重用,提升算子效率。

基于“华山”芯片进行横向、纵向的扩展,可以轻松打造十万卡级别的智算集群,每个节点的加速卡就有最多1024块。

为此,“华山”不仅支持摩尔线程自