演讲嘉宾:谭颖然(沐曦股份光启研究院科学家)
所属大会:2026 奇点智能技术大会 · 北京
对奇点智能大会(2026)的完整技术议题感兴趣,可前往奇点大会官方渠道免费获取PPT详细资料。
一、引言:国产 GPU 的破局之战
在全球 AI 算力竞争日益激烈的背景下,GPU 作为 AI 计算的核心芯片,其自主可控已成为国家战略。沐曦股份(MetaX)作为国内领先的 GPU 芯片设计公司,其光启研究院在国产 GPU 架构设计、软件生态建设和产业化落地方面取得了重要突破。
光启研究院科学家谭颖然,将出席本次大会,分享国产 GPU 从芯片设计到 AI 计算平台的完整技术路线,以及自主可控道路上的挑战与机遇。
二、国产 GPU 的技术挑战
2.1 与 NVIDIA/AMD 的差距
国产 GPU 在多个维度仍面临挑战:
| 维度 | 国际领先水平 | 国产 GPU 现状 | 差距 |
|---|---|---|---|
| 制程工艺 | 3nm/4nm | 7nm/12nm | 2-3 代 |
| 算力密度 | 1000+ TFLOPS | 200-500 TFLOPS | 2-5x |
| 显存带宽 | 5+ TB/s | 1-2 TB/s | 2-3x |
| 软件生态 | CUDA 成熟生态 | 自建生态 | 巨大 |
| 开发者社区 | 数百万开发者 | 起步阶段 | 数量级差距 |
| 工具链完善度 | 全栈成熟 | 基础可用 | 显著差距 |
2.2 自主可控的战略意义
尽管存在差距,国产 GPU 的发展具有不可替代的战略价值:
供应链安全 ├─ 避免"卡脖子"风险 ├─ 保障关键行业算力供应 └─ 建立自主技术体系 产业生态 ├─ 培育本土芯片设计人才 ├─ 带动上下游产业发展 └─ 形成完整产业链 技术创新 ├─ 探索差异化架构路线 ├─ 针对本土场景优化 └─ 实现技术自主迭代三、沐曦 GPU 架构设计
3.1 架构设计理念
沐曦 GPU 采用面向 AI 计算优化的架构设计:
classMetaXGPUArchitecture:def__init__(self):self.compute_units=self.init_compute_units()self.memory_hierarchy=self.init_memory()self.interconnect=self.init_interconnect()definit_compute_units(self):"""初始化计算单元阵列"""return{"tensor_cores":TensorCoreArray(count=128),"vector_cores":VectorCoreArray(count=256),"specialized_units":{"matrix_multiply":MMAUnit(),"activation":ActivationUnit(),"normalization":NormUnit()}}definit_memory(self):"""初始化存储层次"""return{"register_file":RegisterFile(size="256 KB/SM"),"shared_memory":SharedMemory(size="164 KB/SM"),"l1_cache":L1Cache(size="128 KB/SM"),"l2_cache":L2Cache(size="64 MB"),"hbm":HBM(capacity="80 GB",bandwidth="2 TB/s")}defexecute_kernel(self,kernel,grid_dim,block_dim):"""执行 GPU 内核"""forblockingrid_dim:forthreadinblock_dim:# 线程调度warp=self.schedule_threads(thread)# 执行指令forinstructioninkernel.instructions:ifinstruction.type=="matrix_multiply":self.compute_units["specialized_units"]["matrix_multiply"].execute(warp)elifinstruction.type=="activation":self.compute_units["specialized_units"]["activation"].execute(warp)# ...3.2 关键技术创新
沐曦 GPU 的核心技术创新:
| 创新点 | 技术方案 | 优势 |
|---|---|---|
| 张量核心设计 | 可变精度 MMA | 支持 INT8/FP16/FP32 混合精度 |
| 存储架构 | 多级缓存 + HBM | 高带宽、低延迟 |
| 互连技术 | 高速片间互连 | 支持多卡扩展 |
| 能效优化 | 动态电压频率调节 | 降低功耗 |
| 安全特性 | 硬件级加密 | 保障数据安全 |
四、软件生态建设
4.1 编程模型
沐曦开发了自研的编程模型和运行时:
# 沐曦 GPU 编程示例importmetax_cudaasmx@mx.kerneldefmatrix_multiply(A,B,C,M,N,K):"""矩阵乘法内核"""# 线程索引row=mx.blockIdx.y*mx.blockDim.y+mx.threadIdx.y col=mx.blockIdx.x*mx.blockDim.x+mx.threadIdx.xifrow<Mandcol<N:# 计算 C[row, col]sum=0.0forkinrange(K):sum+=A[row,k]*B[k,col]C[row,col]=sum# 主机端代码deflaunch_matmul(A,B,C):M,K=A.shape K2,N=B.shapeassertK==K2# 配置网格和线程块block_size=(16,16)grid_size=((N+15)//16,(M+15)//16)# 启动内核matrix_multiply[grid_size,block_size](A,B,C,M,N,K)4.2 深度学习框架适配
沐曦 GPU 适配了主流深度学习框架:
| 框架 | 适配状态 | 性能达成率 |
|---|---|---|
| PyTorch | 完整支持 | 85-90% |
| TensorFlow | 完整支持 | 80-85% |
| PaddlePaddle | 完整支持 | 85-90% |
| OneFlow | 合作适配 | 80%+ |
| 自研框架 | 开发中 | - |
4.3 算子库优化
classMetaXOperatorLibrary:def__init__(self):self.operators={"conv2d":OptimizedConv2D(),"matmul":OptimizedMatMul(),"attention":OptimizedAttention(),"layernorm":OptimizedLayerNorm(),"softmax":OptimizedSoftmax()}defoptimize_for_metax(self,model):"""针对沐曦 GPU 优化模型"""optimized_model=[]foropinmodel.operations:ifop.typeinself.operators:# 使用沐曦优化算子optimized_op=self.operators[op.type].optimize(op)optimized_model.append(optimized_op)else:# 回退到通用实现optimized_model.append(op)returnoptimized_model五、AI 计算平台
5.1 平台架构
沐曦的 AI 计算平台采用软硬件协同设计:
┌─────────────────────────────────────────┐ │ 应用层:大模型训练、推理、微调 │ ├─────────────────────────────────────────┤ │ 框架层:PyTorch/TensorFlow/Paddle │ ├─────────────────────────────────────────┤ │ 中间层:沐曦运行时、算子库、通信库 │ ├─────────────────────────────────────────┤ │ 驱动层:GPU 驱动、内存管理、任务调度 │ ├─────────────────────────────────────────┤ │ 硬件层:沐曦 GPU 集群 │ └─────────────────────────────────────────┘5.2 大模型训练支持
classMetaXLLMTraining:def__init__(self,model_config,hardware_config):self.model=build_model(model_config)self.hardware=MetaXCluster(hardware_config)self.distributed_strategy=self.select_strategy(model_config)defselect_strategy(self,model_config):"""选择分布式训练策略"""model_size=model_config.num_paramsifmodel_size<7e9:returnDataParallelStrategy()elifmodel_size<70e9:returnTensorParallelStrategy(tp_size=8)else:returnHybridParallelStrategy(tp_size=8,pp_size=8,dp_size=4)deftrain(self,dataset,num_epochs):"""训练大模型"""forepochinrange(num_epochs):forbatchindataset:# 前向传播loss=self.model(batch)# 反向传播loss.backward()# 梯度同步self.distributed_strategy.all_reduce_gradients()# 参数更新self.optimizer.step()self.optimizer.zero_grad()六、产业化挑战与对策
6.1 主要挑战
| 挑战 | 表现 | 对策 |
|---|---|---|
| 生态建设 | 开发者习惯 CUDA | 兼容层 + 原生优化 |
| 性能优化 | 与 NVIDIA 有差距 | 场景针对性优化 |
| 成本控制 | 研发投入大 | 政府支持 + 产业合作 |
| 人才短缺 | GPU 设计人才稀缺 | 产学研联合培养 |
| 市场接受 | 用户担心兼容性 | 渐进式替代策略 |
6.2 渐进式替代策略
第一阶段:新场景优先 ├─ 新建数据中心优先采用国产 GPU ├─ 不与现有 CUDA 生态冲突 └─ 积累实际运行经验 第二阶段:混合部署 ├─ 国产 GPU 处理特定负载 ├─ NVIDIA GPU 处理通用负载 └─ 建立统一调度层 第三阶段:逐步替代 ├─ 扩大国产 GPU 使用比例 ├─ 完善软件生态 └─ 实现主要场景自主可控七、未来展望
7.1 技术路线图
沐曦 GPU 的技术发展路线:
- 2024-2025:完善现有架构,提升软件生态成熟度
- 2025-2027:下一代架构,追赶国际先进水平
- 2027-2030:实现与国际领先水平并跑
- 2030+:在特定领域实现领跑
7.2 产业生态建设
- 开发者社区:建立活跃的开发者社区和开源项目
- 教育合作:与高校合作培养 GPU 设计和优化人才
- 行业标准:参与制定国产 AI 芯片行业标准
- 国际合作:在合规前提下开展国际技术交流
八、总结
谭颖然的分享将展示国产 GPU 自主可控的完整图景。从芯片架构到软件生态,从技术创新到产业化落地,每一个环节都体现了中国芯片人的执着与智慧。
2026 年 11 月,奇点智能技术大会,与谭颖然一起探索国产 GPU 的自主可控之路。
大会信息
2026 奇点智能技术大会 + C++ 及系统软件技术大会
时间:2026 年 11 月 20-21 日
地点:中国·北京万达文华酒店
参会报名:https://boolan.com/enroll/c1051/event/1162?channel=seo
立即报名,了解国产 GPU 的自主可控技术路线!