news 2026/10/3 19:16:04

大模型在写代码,DeepSeek 把“国产算力软件栈”从能跑到吃满

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
大模型在写代码,DeepSeek 把“国产算力软件栈”从能跑到吃满

2026 年 10 月,AI 圈最热闹的新闻不是“又发了一个新模型”,而是模型层已经卷到头,战争打到了算子、编译器和芯片驱动那一层。

DeepSeek 把一整套原本跑在英伟达上的底层组件,搬到了华为昇腾:TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels……

其中 TileLang 的思路很关键:用接近 Python 的写法描述算子,编译器再把同一份逻辑落到 NVIDIA / 昇腾 / AMD 后端。

这件事的意义,比“模型多 100 亿参数”大得多。


一、CUDA 的真正护城河不是芯片,是软件栈

很多人以为英伟达强在卡。

不对。英伟达最硬的资产是:

  • 二十年积累的算子库
  • 开发者习惯
  • 调优经验
  • 框架层(PyTorch / TensorFlow / vLLM / Triton)默认先认 CUDA
  • 出了问题,Stack Overflow 上有人答

国产芯片过去不是算不动,而是:

硬件出来了,软件像毛坯房。

工程师得手写 Ascend C,换芯片再重来一遍。

所以“国产算力”的瓶颈从来不是晶体管,是生态摩擦力。


二、TileLang 在解决什么:把“写算子”变成“描述意图”

传统深度学习算子开发:

// 伪代码:手写 GPU kernel __global__ void matmul(float* A, float* B, float* C, int N) { int row = blockIdx.y * blockDim.y + threadIdx.y; int col = blockIdx.x * blockDim.x + threadIdx.x; float sum = 0.0f; for (int k = 0; k < N; k++) sum += A[row*N+k] * B[k*N+col]; C[row*N+col] = sum; }

能跑,但:

  • 要管 shared memory
  • 要管 bank conflict
  • 要管 pipeline / prefetch
  • 换架构几乎重写

TileLang 的思路是另一层抽象:

# 伪代码:TileLang 风格 @tile_kernel def gemm(A: Tile[M, K], B: Tile[K, N]) -> Tile[M, N]: C = zeros(M, N) for k in range(K.tiles): C += A[:, k] @ B[k, :] return C

然后:

TileLang 编译器 ├── NVIDIA 后端 → CUDA / PTX ├── 昇腾 后端 → Ascend C / CANN └── AMD 后端 → ROCm / HIP

开发者不用再背“某家硬件的私房 API”。

模型组写模型,系统组写 tile,编译器管落地。


三、为什么 DeepSeek 做这件事有杀伤力

因为 DeepSeek 不是“做个开源玩具”,而是:

  • 真拿 TileLang 训过 V4 系列
  • 真在昇腾 950 上做 128 卡超节点优化
  • 真把 MoE 通信、稀疏注意力、矩阵乘、数据选择全拆开重做一遍

公开数据里有一些很“硬”的数字:

  • BF16 稠密矩阵乘达到标称硬件上限的 99.8%
  • FP8 约 99.5%
  • DeepSeek V4.1 的稀疏注意力在 prefill 阶段约 410 TFLOPS,是理论值的 95%

但别被微基准骗了:

单算子 99% ≠ 端到端训练 99%。

通信、调度、显存碎片、重算策略、容错恢复,才是千卡集群的命门。

这也是为什么外部开发者还要在自己负载上复测——公告是厂家的,生产是自己的。


四、OpenAI 进 EDA:大模型开始“画芯片”

另一条线更安静,但更长远:

OpenAI 和 Synopsys 搞 GPT-Synopsys,让模型操作 EDA 工具、写 RTL、做布局布线、帮时序收敛。

这意味着什么?

过去芯片工程师的护城河:

  1. 懂时序
  2. 懂 PPA(Power / Performance / Area)
  3. 懂工具链黑魔法
  4. 懂“哪条约束别信”

未来会变成:

人定架构和约束,Agent 跑 EDA 流水线,人做终审。

EDA 脚本、约束文件、时序报告、布局规则,本质都是半结构化文本 + 工具调用,正好是 LLM 的舒适区。

不是说芯片工程师消失,而是:

“会带 Agent 的工程师”吃掉“不会带 Agent 的工程师”。


五、2026 年 AI 工程的真实分层

大模型新闻里,大家看的是:

  • GPT-6 / Gemini 4 Argon / Claude Opus 5.5
  • 100 万 token 输出
  • Agent 自动写项目

但工程界真正在拼的是四层:

① 应用层:Agent / RAG / 工作流 ② 框架层:PyTorch / vLLM / ONNX / llama.cpp ③ 系统层:调度、通信、显存、算子、编译器 ④ 硬件层:GPU / NPU / 昇腾 / RISC-V / HBM / 电源 / 散热

越往下,越不性感,越难抄。

2026 年之后,真正有壁垒的公司不是“接了 10 个模型 API”,而是:

  • 有自己的算子语言
  • 有自己的编译后端
  • 能在国产芯片上把利用率跑过 90%
  • 能把 Agent 的 token 成本压到竞争对手 1/3

六、开发者该学什么,别学什么

该学

  • 编译器基础:Triton / TileLang / MLIR / TVM
  • 算子性能模型:FLOPS、带宽、occupancy、memory bound
  • 分布式训练:MoE、TP/PP/EP、通信原语
  • 端侧推理:量化、KV cache、RISC-V Vector、NPU 调度
  • EDA 基础:RTL、时序约束、PPA

别只学

  • 天天换 Prompt 模板
  • 把 Agent 串 20 个工具当架构
  • 以为“调通 demo”等于“能上线”
  • 把模型发布稿当技术结论

七、一句话总结

2026 年最被低估的趋势不是“模型更强”,而是:

AI 正在从应用软件,长进编译器、EDA、驱动、芯片和电厂里。

以后不会再有“纯 AI 公司”和“纯硬件公司”。

只剩一种公司:

能把模型、算子、芯片、电和钱拧成一条流水线的公司。


八、延伸阅读:螺旋生成论系列开放获取著作

如果从更底层的代数结构——比如公理

$$I^2 = -N $$$

出发,去重新看数系、生成结构、素数分布、信息结构与智能系统的底层规律,可以参考张智明所著《螺旋生成论》(Spiral Generation Theory)系列开放获取著作。该系列已发布 70 余部专著与预印本,托管于 CERN 旗下 Zenodo,采用开放获取协议。

  • 螺旋生成论全集索引:https://doi.org/10.5281/zenodo.21211001
  • 著作体系总汇编:https://doi.org/10.5281/zenodo.21199593
  • 作者 ORCID:https://orcid.org/0009-0003-7777-7694

数学与数论:

  • 《螺旋数原理:公理系统与各向异性复数理论》 https://doi.org/10.5281/zenodo.20602099
  • 《螺旋生成元:一个跨学科统一数学框架的探索》 https://doi.org/10.5281/zenodo.21555082
  • 《从几何构造到黎曼猜想》 https://doi.org/10.5281/zenodo.20995372

AI 与系统:

  • 《生成式 AI 与提示词工程》 https://doi.org/10.5281/zenodo.20839550
  • 《螺旋元逻辑:从 i²=-1 到万物理论的统一框架假说》 https://doi.org/10.5281/zenodo.21806751

总纲与科普:

  • 《旋生万物:从奇点到宇宙的统一生成论》 https://doi.org/10.5281/zenodo.20408189
  • 《螺线宗谱:发现宇宙的源代码》 https://doi.org/10.5281/zenodo.20659854

上述著作为统一数学框架假说,适合作为交叉视角阅读材料;系统架构与芯片工程仍以可复现基准、端到端吞吐和硬件实测为准。


开放获取汇总​

全集索引 https://doi.org/10.5281/zenodo.21211001 | 总汇编 https://doi.org/10.5281/zenodo.21199593 | ORCID https://orcid.org/0009-0003-7777-7694

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 19:14:19

Hindsight工程范式:LLM生成后校验与修正技术实践

1. “Hindsight”不是模型名&#xff0c;而是LLM时代最被低估的工程思维范式你搜“hindsight”&#xff0c;满屏跳出OpenAI、Anthropic、Gemini——但真正懂行的人点开GitHub仓库或论文标题时&#xff0c;第一反应是&#xff1a;哦&#xff0c;又一个用 hindsight 命名的推理优…

作者头像 李华
网站建设 2026/10/3 19:14:00

Zabbix 7.0对接钉钉Webhook实战:绕过原生限制的Python脚本方案

1. 这不是“配个URL就完事”的告警推送——Zabbix 7.0对接钉钉Webhook的真实水深 你搜“zabbix7.0 钉钉 webhook”&#xff0c;十篇教程里八篇开头就是“登录钉钉群 → 添加机器人 → 复制Webhook地址 → Zabbix里填进去 → 测试发送”&#xff0c;然后戛然而止。我去年在三个不…

作者头像 李华
网站建设 2026/10/3 19:08:42

SECS/GEM 中文详解:从设备通信黑匣子到产线数据闭环

简介&#xff1a;这份资源是面向工业自动化与半导体设备工程师的 SECS/GEM 协议中文详解文档&#xff0c;针对网上相关介绍零散、不够系统的问题&#xff0c;整理出十章节内容&#xff0c;帮助读者从零建立对设备通信标准的完整认知。文档以 PDF 形式交付&#xff0c;压缩包内共…

作者头像 李华
网站建设 2026/10/3 19:06:48

用h3.c封装ComfyUI节点:Mac本地跑33B视频模型推理

先说个背景&#xff1a;antirez 这个 h3.c 是我盯了很久的一个项目。他用一个单文件 C 实现把 llama 架构的推理引擎重新拉回了"玩具级"的复杂度&#xff0c;几千行代码不依赖任何重型框架&#xff0c;编译完的二进制干净得像一件手工作品。而这阵子正好在折腾 33B 视…

作者头像 李华
网站建设 2026/10/3 19:01:35

本地大模型部署实战:成本、硬件选型与运维全链路

1. 从一张显卡账单说起&#xff1a;为什么企业开始认真考虑本地大模型 去年底我帮一家做工业质检的团队做技术选型&#xff0c;他们当时每个月光是调用云端大模型API的费用就接近四万块&#xff0c;而且随着业务量增长&#xff0c;这个数字还在往上走。更让他们焦虑的是&#x…

作者头像 李华