news 2026/9/10 2:46:49

CANN/ge实验参数配置

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CANN/ge实验参数配置

试验参数

【免费下载链接】geGE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力,并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge

ALLOW_HF32

该参数预留,当前版本暂不支持

是否启用HF32自动代替float32数据类型的功能,当前版本该参数仅针对Conv类算子与Matmul类算子生效。此参数实际对应的options参数为ge.exec.allow_hf32

HF32是昇腾推出的专门用于算子内部计算的单精度浮点类型,与其他常用数据类型的比较如下图所示。可见,HF32与float32支持相同的数值范围,但尾数位精度(11位)却接近FP16(10位)。通过降低精度让HF32单精度数据类型代替原有的float32单精度数据类型,可大大降低数据所占空间大小,实现性能的提升。

参数取值:

  • true:针对Conv类算子与Matmul类算子,开启FP32数据类型自动转换为HF32数据类型的功能。

    具体涉及哪些算子,请参见CANN软件安装后文件存储路径的opp/built-in/op_impl/ai_core/tbe/impl_mode/allow_hf32_matmul_t_conv_t.ini,该文件不支持用户修改。

  • false:针对Conv类算子与Matmul类算子,关闭FP32数据类型自动转换为HF32数据类型的功能。

    具体涉及哪些算子,请参见CANN软件安装后文件存储路径的opp/built-in/op_impl/ai_core/tbe/impl_mode/allow_hf32_matmul_f_conv_f.ini,该文件不支持用户修改。

**参数默认值:**针对Conv类算子,默认开启FP32到HF32的转换;针对Matmul类算子,默认关闭该转换功能。

使用约束

  • 针对同一个算子,如果通过OP_PRECISION_MODE参数配置了enable_hi_float_32_execution或enable_float_32_execution,该场景下不建议再与ALLOW_HF32参数同时使用,若同时使用,则优先级如下:

    OP_PRECISION_MODE(ByNodeName,按节点名称设置精度模式) > ALLOW_HF32 > OP_PRECISION_MODE(ByOpType,按算子类型设置精度模式)。

  • 由于ALLOW_HF32是使用HF32自动代替float32,要想该参数生效,必须保证被涉及算子的输入或者输出类型为float32。由于PRECISION_MODE_V2参数默认值为fp16,原始网络模型中算子类型为float32时会被强制转为float16类型,该场景下使用ALLOW_HF32参数不生效,建议修改PRECISION_MODE_V2参数值为origin(PRECISION_MODE参数默认值为force_fp16,建议修改为must_keep_origin_dtype或者force_fp32)。

配置示例:

{ge::ir_option::ALLOW_HF32, "true"}

产品支持情况:

  • Ascend 950PR/Ascend 950DT:支持
  • Atlas A3 训练系列产品/Atlas A3 推理系列产品:支持
  • Atlas A2 训练系列产品/Atlas A2 推理系列产品:支持
  • Atlas 200I/500 A2 推理产品:不支持
  • Atlas 推理系列产品:不支持
  • Atlas 训练系列产品:不支持
  • IPV350:不支持

OO_CONSTANT_FOLDING

调试功能扩展参数,当前不支持应用于商用产品中,后续版本会作为正式功能更新发布。

是否开启常量折叠优化。此参数实际对应的options参数为ge.oo.constantFolding

常量折叠是将计算图中可以预先确定输出值的节点替换成常量,并对计算图进行一些结构简化的操作。

参数取值:

  • true:(默认值)开启。
  • false:关闭。

配置示例:

{ge::ir_option::OO_CONSTANT_FOLDING, "true"}

产品支持情况:

全量芯片支持。

OO_DEAD_CODE_ELIMINATION

调试功能扩展参数,当前不支持应用于商用产品中,后续版本会作为正式功能更新发布。

是否开启死边消除优化。此参数实际对应的options参数为ge.oo.deadCodeElimination

死边消除:switch死边消除,switch的pred输入(1号输入)为const节点时,根据const的值消除其中一条分支:const为true时,消除false分支;const为false时,消除true分支。

参数取值:

  • true:(默认值)开启。
  • false:关闭。

配置示例:

{ge::ir_option::OO_DEAD_CODE_ELIMINATION, "true"}

产品支持情况:

全量芯片支持。

OO_LEVEL

调试功能扩展参数,当前不支持应用于商用产品中,后续版本会作为正式功能更新发布。

图编译多级优化选项,包括子图优化、整图优化、静态Shape模型下沉等。此参数实际对应的options参数为ge.oo.level

静态Shape模型下沉:静态Shape模型在编译时即可确定所有算子的输入输出Shape,完成模型级内存编排、算子的Tiling计算等Host侧计算,在模型加载时整体下发到Device流上,但不立即执行,通过下发模型执行Task触发模型中所有Task的执行。

参数取值:

  • O1:会关闭所有图融合和UB融合Pass,只做促成静态下沉的相关优化,如InferShape(进行输出Tensor的shape推导)、常量折叠、死边消除等。

    Ascend 950PR/Ascend 950DT不支持UB融合,只关闭图融合Pass。

  • O3:(默认值)开启所有优化。

使用约束:

取值为O1时,会关闭所有图融合和UB融合PASS,只开启静态下沉的相关PASS,但是如下路径文件中的图融合PASS,由于关闭后会有功能问题,会默认开启:

${INSTALL_DIR}/_<arch>_-linux/lib64/plugin/opskernel/fusion_pass/config/fusion_config.json文件中"ExceptionalPassOfO1Level"字段下的所有图融合PASS。

其中${INSTALL_DIR}请替换为CANN软件安装后文件存储路径。以root用户安装为例,安装后文件默认存储路径为:/usr/local/Ascend/cann。<arch>表示具体操作系统架构。

配置示例:

{ge::ir_option::OO_LEVEL, "O3"}

产品支持情况:

全量芯片支持。

TUNE_DEVICE_IDS

当前版本暂不支持

【免费下载链接】geGE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力,并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 2:46:20

本体建模与知识图谱构建实战:从OWL到SPARQL的工程落地

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/10 2:44:41

开源AI Agent平台选型指南:从分类对比到企业落地实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/10 2:44:03

CANN/ge aclgrphBuildModel基础功能配置

基础功能 【免费下载链接】ge GE&#xff08;Graph Engine&#xff09;是面向昇腾的图编译器和执行器&#xff0c;提供了计算图优化、多流并行、内存复用和模型下沉等技术手段&#xff0c;加速模型执行效率&#xff0c;减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的…

作者头像 李华
网站建设 2026/9/10 2:40:37

从欧拉常数到-1/12:发散级数背后的数学统一

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华