news 2026/9/1 11:45:50

26年奇点智能大会谭颖然:沐曦光启国产GPU——从芯片设计到AI计算平台的自主可控之路

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
26年奇点智能大会谭颖然:沐曦光启国产GPU——从芯片设计到AI计算平台的自主可控之路

演讲嘉宾:谭颖然(沐曦股份光启研究院科学家)
所属大会:2026 奇点智能技术大会 · 北京
对奇点智能大会(2026)的完整技术议题感兴趣,可前往奇点大会官方渠道免费获取PPT详细资料。

一、引言:国产 GPU 的破局之战

在全球 AI 算力竞争日益激烈的背景下,GPU 作为 AI 计算的核心芯片,其自主可控已成为国家战略。沐曦股份(MetaX)作为国内领先的 GPU 芯片设计公司,其光启研究院在国产 GPU 架构设计、软件生态建设和产业化落地方面取得了重要突破。

光启研究院科学家谭颖然,将出席本次大会,分享国产 GPU 从芯片设计到 AI 计算平台的完整技术路线,以及自主可控道路上的挑战与机遇。

二、国产 GPU 的技术挑战

2.1 与 NVIDIA/AMD 的差距

国产 GPU 在多个维度仍面临挑战:

维度国际领先水平国产 GPU 现状差距
制程工艺3nm/4nm7nm/12nm2-3 代
算力密度1000+ TFLOPS200-500 TFLOPS2-5x
显存带宽5+ TB/s1-2 TB/s2-3x
软件生态CUDA 成熟生态自建生态巨大
开发者社区数百万开发者起步阶段数量级差距
工具链完善度全栈成熟基础可用显著差距

2.2 自主可控的战略意义

尽管存在差距,国产 GPU 的发展具有不可替代的战略价值:

供应链安全 ├─ 避免"卡脖子"风险 ├─ 保障关键行业算力供应 └─ 建立自主技术体系 产业生态 ├─ 培育本土芯片设计人才 ├─ 带动上下游产业发展 └─ 形成完整产业链 技术创新 ├─ 探索差异化架构路线 ├─ 针对本土场景优化 └─ 实现技术自主迭代

三、沐曦 GPU 架构设计

3.1 架构设计理念

沐曦 GPU 采用面向 AI 计算优化的架构设计

classMetaXGPUArchitecture:def__init__(self):self.compute_units=self.init_compute_units()self.memory_hierarchy=self.init_memory()self.interconnect=self.init_interconnect()definit_compute_units(self):"""初始化计算单元阵列"""return{"tensor_cores":TensorCoreArray(count=128),"vector_cores":VectorCoreArray(count=256),"specialized_units":{"matrix_multiply":MMAUnit(),"activation":ActivationUnit(),"normalization":NormUnit()}}definit_memory(self):"""初始化存储层次"""return{"register_file":RegisterFile(size="256 KB/SM"),"shared_memory":SharedMemory(size="164 KB/SM"),"l1_cache":L1Cache(size="128 KB/SM"),"l2_cache":L2Cache(size="64 MB"),"hbm":HBM(capacity="80 GB",bandwidth="2 TB/s")}defexecute_kernel(self,kernel,grid_dim,block_dim):"""执行 GPU 内核"""forblockingrid_dim:forthreadinblock_dim:# 线程调度warp=self.schedule_threads(thread)# 执行指令forinstructioninkernel.instructions:ifinstruction.type=="matrix_multiply":self.compute_units["specialized_units"]["matrix_multiply"].execute(warp)elifinstruction.type=="activation":self.compute_units["specialized_units"]["activation"].execute(warp)# ...

3.2 关键技术创新

沐曦 GPU 的核心技术创新:

创新点技术方案优势
张量核心设计可变精度 MMA支持 INT8/FP16/FP32 混合精度
存储架构多级缓存 + HBM高带宽、低延迟
互连技术高速片间互连支持多卡扩展
能效优化动态电压频率调节降低功耗
安全特性硬件级加密保障数据安全

四、软件生态建设

4.1 编程模型

沐曦开发了自研的编程模型和运行时:

# 沐曦 GPU 编程示例importmetax_cudaasmx@mx.kerneldefmatrix_multiply(A,B,C,M,N,K):"""矩阵乘法内核"""# 线程索引row=mx.blockIdx.y*mx.blockDim.y+mx.threadIdx.y col=mx.blockIdx.x*mx.blockDim.x+mx.threadIdx.xifrow<Mandcol<N:# 计算 C[row, col]sum=0.0forkinrange(K):sum+=A[row,k]*B[k,col]C[row,col]=sum# 主机端代码deflaunch_matmul(A,B,C):M,K=A.shape K2,N=B.shapeassertK==K2# 配置网格和线程块block_size=(16,16)grid_size=((N+15)//16,(M+15)//16)# 启动内核matrix_multiply[grid_size,block_size](A,B,C,M,N,K)

4.2 深度学习框架适配

沐曦 GPU 适配了主流深度学习框架:

框架适配状态性能达成率
PyTorch完整支持85-90%
TensorFlow完整支持80-85%
PaddlePaddle完整支持85-90%
OneFlow合作适配80%+
自研框架开发中-

4.3 算子库优化

classMetaXOperatorLibrary:def__init__(self):self.operators={"conv2d":OptimizedConv2D(),"matmul":OptimizedMatMul(),"attention":OptimizedAttention(),"layernorm":OptimizedLayerNorm(),"softmax":OptimizedSoftmax()}defoptimize_for_metax(self,model):"""针对沐曦 GPU 优化模型"""optimized_model=[]foropinmodel.operations:ifop.typeinself.operators:# 使用沐曦优化算子optimized_op=self.operators[op.type].optimize(op)optimized_model.append(optimized_op)else:# 回退到通用实现optimized_model.append(op)returnoptimized_model

五、AI 计算平台

5.1 平台架构

沐曦的 AI 计算平台采用软硬件协同设计

┌─────────────────────────────────────────┐ │ 应用层:大模型训练、推理、微调 │ ├─────────────────────────────────────────┤ │ 框架层:PyTorch/TensorFlow/Paddle │ ├─────────────────────────────────────────┤ │ 中间层:沐曦运行时、算子库、通信库 │ ├─────────────────────────────────────────┤ │ 驱动层:GPU 驱动、内存管理、任务调度 │ ├─────────────────────────────────────────┤ │ 硬件层:沐曦 GPU 集群 │ └─────────────────────────────────────────┘

5.2 大模型训练支持

classMetaXLLMTraining:def__init__(self,model_config,hardware_config):self.model=build_model(model_config)self.hardware=MetaXCluster(hardware_config)self.distributed_strategy=self.select_strategy(model_config)defselect_strategy(self,model_config):"""选择分布式训练策略"""model_size=model_config.num_paramsifmodel_size<7e9:returnDataParallelStrategy()elifmodel_size<70e9:returnTensorParallelStrategy(tp_size=8)else:returnHybridParallelStrategy(tp_size=8,pp_size=8,dp_size=4)deftrain(self,dataset,num_epochs):"""训练大模型"""forepochinrange(num_epochs):forbatchindataset:# 前向传播loss=self.model(batch)# 反向传播loss.backward()# 梯度同步self.distributed_strategy.all_reduce_gradients()# 参数更新self.optimizer.step()self.optimizer.zero_grad()

六、产业化挑战与对策

6.1 主要挑战

挑战表现对策
生态建设开发者习惯 CUDA兼容层 + 原生优化
性能优化与 NVIDIA 有差距场景针对性优化
成本控制研发投入大政府支持 + 产业合作
人才短缺GPU 设计人才稀缺产学研联合培养
市场接受用户担心兼容性渐进式替代策略

6.2 渐进式替代策略

第一阶段:新场景优先 ├─ 新建数据中心优先采用国产 GPU ├─ 不与现有 CUDA 生态冲突 └─ 积累实际运行经验 第二阶段:混合部署 ├─ 国产 GPU 处理特定负载 ├─ NVIDIA GPU 处理通用负载 └─ 建立统一调度层 第三阶段:逐步替代 ├─ 扩大国产 GPU 使用比例 ├─ 完善软件生态 └─ 实现主要场景自主可控

七、未来展望

7.1 技术路线图

沐曦 GPU 的技术发展路线:

  1. 2024-2025:完善现有架构,提升软件生态成熟度
  2. 2025-2027:下一代架构,追赶国际先进水平
  3. 2027-2030:实现与国际领先水平并跑
  4. 2030+:在特定领域实现领跑

7.2 产业生态建设

  • 开发者社区:建立活跃的开发者社区和开源项目
  • 教育合作:与高校合作培养 GPU 设计和优化人才
  • 行业标准:参与制定国产 AI 芯片行业标准
  • 国际合作:在合规前提下开展国际技术交流

八、总结

谭颖然的分享将展示国产 GPU 自主可控的完整图景。从芯片架构到软件生态,从技术创新到产业化落地,每一个环节都体现了中国芯片人的执着与智慧。

2026 年 11 月,奇点智能技术大会,与谭颖然一起探索国产 GPU 的自主可控之路。


大会信息
2026 奇点智能技术大会 + C++ 及系统软件技术大会
时间:2026 年 11 月 20-21 日
地点:中国·北京万达文华酒店
参会报名:https://boolan.com/enroll/c1051/event/1162?channel=seo

立即报名,了解国产 GPU 的自主可控技术路线!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 11:45:47

Ubuntu零基础入门到精通【5.4讲】:软件包的安装、卸载、搜索与更新——从入门到工程实践的完整指南!

🏆 本文收录于 《滚雪球学 Ubuntu》 专栏。 本专栏面向有一定计算机基础,但尚未系统学习 Linux / Ubuntu 的读者,采用“滚雪球式学习法”:先装好、再会用、再理解、再优化、再实战,带你从第一次进入 Ubuntu 桌面 / 终端开始,逐步掌握 Ubuntu 的日常使用、命令操作、软件…

作者头像 李华
网站建设 2026/9/1 11:43:48

DragGAN 上手教程:5分钟搞定零代码拖拽图像编辑

DragGAN 上手教程&#xff1a;5分钟搞定零代码拖拽图像编辑 【免费下载链接】DragGAN Official Code for DragGAN (SIGGRAPH 2023) 项目地址: https://gitcode.com/GitHub_Trending/dr/DragGAN 这篇文章解决一件事&#xff1a;把 DragGAN 装进你的机器&#xff0c;用拖拽…

作者头像 李华
网站建设 2026/9/1 11:39:48

STM32电机双闭环控制:位置环+速度环串级PID的工程实现与调参实战

简介&#xff1a;一套基于STM32-F4平台的位置环速度双闭环串级控制方案&#xff0c;采用位置式PID算法&#xff0c;配套下位机HAL库源代码&#xff0c;面向电机控制方向的嵌入式学习者与开发者&#xff0c;解决无刷电机位置与速度精确调节及PID参数在线整定问题。代码支持按键和…

作者头像 李华
网站建设 2026/9/1 11:38:37

ArcGIS数据处理实战:坐标系、栅格对齐与高频报错排查指南

简介&#xff1a;这份ArcGIS地图数据资源面向GIS初学者、地图制作者及二次开发人员&#xff0c;既可用于理解ArcGIS图层组织与地图文档结构&#xff0c;也可作为多尺度空间分析的基础底图。压缩包内包含ArcGIS地图文档、矢量数据、图层文件及配套投影和元数据&#xff0c;共24个…

作者头像 李华
网站建设 2026/9/1 11:38:35

Hadoop 2.6.5安装配置实战:从伪分布式到踩坑记录

简介&#xff1a;这是Apache Hadoop 2.6.5的Linux安装包&#xff0c;面向需要搭建分布式计算实验环境的大数据初学者、运维及开发工程师&#xff0c;解决Hadoop环境准备与基础集群部署问题。压缩包共900个文件&#xff0c;约175.09MB&#xff0c;包含477个jar依赖库、129个clas…

作者头像 李华
网站建设 2026/9/1 11:38:25

2026华为AI岗备考全攻略:机试、面试与项目复盘

2026年华为AI岗&#xff0c;5月22号这个时间点&#xff0c;很多人一看就明白&#xff0c;这是暑假实习加秋招提前批的节点。作为一个带过不少学弟学妹上岸、自己也经历过华为OD和正式岗完整流程的人&#xff0c;我直接说结论&#xff1a;华为AI岗的核心筛选逻辑&#xff0c;根本…

作者头像 李华