news 2026/8/12 17:18:59

12.RK3588本地大模型性能评估优化

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
12.RK3588本地大模型性能评估优化

1.性能分析基础

进行性能评估前,先建立一个基准,方便后续对比

请参考 15.RK3588 查询和设置板子配置 把板子CPU、NPU、DDR运行频率设置到最大,后续的性能分析都在这个基准上比较,避免动态调频导致性能表现出现误差

整个部署程序的推理部分耗时的占用有如下三个方面:用户应用程序耗时、输入输出数据拷贝耗时、模型推理耗时。

2.开启性能调试

2.1 板子Linux系统里进行性能分析

#设置日志级别 export RKNN_LOG_LEVEL=4 #运行大模型 ./run_rknn_test ./test.rknn ./input.jpg

比如运行大模型

./demo demo.jpg ../models/qwen3-vl_vision_rk3588.rknn ../models/qwen3-vl-2b-instruct_w8a8_rk3588.rkllm 2048 4096 3 "<|vision_start|>" "<|vision_end|>" "<|image_pad|>"

就可以看到性能耗时

可以看到 Expand 和 Transpose是运行在CPU上的,可以通过算子替换等把它修改到NPU上以提高性能

比如

2.2 rknn-toolkit2里运行性能分析

这个是在ubuntu PC机里,通过python 调用rknn-toolkit2,连接到板端进行性能分析

需要调用eval_perf获取每一层的耗时情况

# perf_debug 需要改为True rknn.init_runtime(target=platform, perf_debug=True) #获取性能情况 rknn.eval_perf()

运行结果

2.3 优化方法

2.3.1算子替代

比如上述文章提到的用固定输出尺寸静态Resize代替动态Resize

2.3.2强制指定算子跑 NPU

转换时配置 op_target 强制指定算子跑 NPU(工具 API 强制调度)

如果算子硬件本身支持,只是编译器自动切到 CPU,用op_target强制绑定 NPU:

rknn.config( target_platform="rk3588", op_target={ # key=算子输出节点名(Netron查看), value=npu/cpu "node_123": "npu", "avgpool_out": "npu" } )

适用场景:AvgPool、Resize、Add、Mul 等基础算子误 fallback。

2.3.3 int8量化上NPU

量化参数适配,消除量化导致的算子降级

很多算子 FP32 不支持 NPU,INT8 量化后即可上 NPU:

rknn.config( quantized_method="channel", # 按通道量化兼容性更好 quantized_algorithm="normal", channel_wise_quantization=True #True=INT8量化,False=FP16/FP32 )

补充:输入输出尽量统一 INT8,避免浮点分支触发 CPU 子图。

2.3.4 激活值量化损失(绝大多数精度掉点元凶)

推理时每层 feature map 数值分布不稳定、极值异常

优化方法:量化校准优化(最高性价比,优先做)

量化核心:依靠校准数据集统计激活值范围 (min/max),决定量化缩放因子

校准数据集作用:前向跑一遍模型,收集每层输出特征图所有数值,统计该层激活全局 min、max。

-- 剔除极端异常值,精度就能提升

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/12 17:16:26

这款个人网站太绝了!这可能是开源社区中最强大的个人网站开源项目,3分钟快速搭建特色个人网站和社区

&#x1f482; 个人网站: IT知识小屋&#x1f91f; 版权: 本文由【IT学习日记】原创、在CSDN首发、需要转载请联系博主&#x1f4ac; 如果文章对你有帮助、欢迎关注、点赞、收藏(一键三连)和订阅专栏哦 文章目录简介特点功能界面功能列表开源地址&使用手册写在最后简介 Sy…

作者头像 李华
网站建设 2026/8/12 17:15:15

2026 企业级地址解析服务商选型指南

在企业数字化转型进程中,地址解析是空间数据应用的基础能力,选型适配的地址解析服务商直接决定业务效率与风控水平。当前市场服务商能力分层明显,多数企业易混淆 C 端地图与企业级地址解析的边界,导致投入产出不及预期。丰图科技作为具备工业级数据底座的企业级地址解析服务商,…

作者头像 李华
网站建设 2026/8/12 17:15:04

特斯拉Model 3/Y CAN总线数据字典:从DBC文件解析到高级应用实践

特斯拉Model 3/Y CAN总线数据字典&#xff1a;从DBC文件解析到高级应用实践 【免费下载链接】model3dbc DBC file for Tesla Model 3 CAN messages 项目地址: https://gitcode.com/gh_mirrors/mo/model3dbc 想要深入理解特斯拉Model 3和Model Y的电子神经系统吗&#xf…

作者头像 李华
网站建设 2026/8/12 17:14:52

iOS 上架审核 4.3(a) 最新2026全面解读

由于AI时代的爆发, 很多外行人员成为了开发者, 借助各种AI工具开发自己的产品 ,那么就会伴随AppStore 的提审量剧增, 同样会伴随4.3(a) 的剧增Guideline(s), 4.3 - Spam针对4.3(a)问题 , 苹果给出解释: 这个条例有几个目的 1: 限制违规开发者的再次提交2: 控制AppStore数量…

作者头像 李华
网站建设 2026/8/12 17:14:42

如何免费解锁Cursor Pro功能:终极完整指南,告别AI编程限制

如何免费解锁Cursor Pro功能&#xff1a;终极完整指南&#xff0c;告别AI编程限制 【免费下载链接】cursor-free-vip [Support 0.45]&#xff08;Multi Language 多语言&#xff09;自动注册 Cursor Ai &#xff0c;自动重置机器ID &#xff0c; 免费升级使用Pro 功能: Youve r…

作者头像 李华
网站建设 2026/8/12 17:14:19

计算机考研408真题深度研读:从命题演进到知识网络构建

1. 一份跨越十二年的“硬通货”&#xff1a;为什么408真题值得你反复咀嚼 如果你正在准备计算机考研&#xff0c;或者对计算机专业基础知识的体系化学习有需求&#xff0c;那么“计算机408统考真题”这几个字对你来说&#xff0c;绝对不陌生。它几乎是每一个计算机考研人绕不开…

作者头像 李华