news 2026/7/23 17:41:36

C++性能分析

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
C++性能分析

目录

一,性能对比

二,性能分析工具

1,VS性能分析工具

2,汇编分析工具

三,计算机性能

1,存储访问

2,处理器性能加速

3,系统调用开销

4,时钟函数

四,编译器优化

1,总体特点

2,指令重排

3,防优化技巧

五,常见代码的性能

1,二维数组的访问

2,大批量内存拷贝

3,多分支语句的顺序

4,循环嵌套条件语句

5,虚函数

6,volatile

六,经验总结

1,异常性能

2,性能优化手段总结

3,增加Cache命中率

4,并行处理


一,性能对比

我们经常对比2份代码的性能,首先要注意控制这几点:

(1)2份代码的功能完全相同

(2)使用相同的测试环境(windows还是linux,编译器等)

(3)使用相同的性能测试代码

(4)使用相同的编译优化级别(VS开release模式)

对于简单的情况,编译器很可能已经做了大量的优化,使得对比结果并不明显。

但是,这却并不代表我们写代码可以完全依赖编译器。

代码的两种写法,在不同程度的编译优化下,哪种写法更快可能没有定论。

例如下面的“循环嵌套条件语句”,clion上运行的是1770 1501,visual studio上运行的是849 1228,感觉应该是vs做的编译优化比较多,简单的if语句可能被优化掉了。

我在windows机器上写C++代码,用cmake编译运行,用clock函数计时,用来判断程序运行时间。

性能测试代码

auto s1 = clock(); test(); auto e1 = clock(); cout << endl << e1 - s1;

二,性能分析工具

1,VS性能分析工具

点击 分析、性能探测器、更改目标

点击 可执行文件、开始、CPU采用、下一步、可执行文件、下一步

填写路径,完成。

2,汇编分析工具

在线汇编

左边可以用不同语言写代码

右边可以选择不同的环境和编译器版本,还支持输入编译选项。

三,计算机性能

1,存储访问

连续的不跳跃的存储访问是最快的,这对程序性能影响很大。

2,处理器性能加速

处理器性能加速:指令乱序执行、流水线、并发

条件分支代码可能打乱流水线,造成性能下降。

3,系统调用开销

read write open close mmap 耗时比较长

4,时钟函数

Linux中的时钟函数

Windows中的时钟函数

四,编译器优化

1,总体特点

2,指令重排

好处是可以提高指令并行度。

int x,y,a; int main() { x=a; y=2; return 0; }

然而从gcc8开始,这个代码在O2下是不进行指令重排的,不知道为啥。

3,防优化技巧

五,常见代码的性能

1,二维数组的访问

二维数组的访问最好不要跳内存。

#include <stdio.h> #include "time.h" #define N 1000000 #define M 1000 typedef struct { int a[N]; }Node; #define OUTCLOCK \ printf("%d ",clock()-theClock); \ theClock=clock(); int main() { clock_t theClock=clock(); Node *p=(Node *)malloc(sizeof(Node)*M); OUTCLOCK for(int i=0;i<M;i++)for(int j=0;j<N;j++)p[i].a[j]=i*j+1; OUTCLOCK for(int j=0;j<N;j++)for(int i=0;i<M;i++)p[i].a[j]=i*j+1; OUTCLOCK return 0; }

运行结果:

0 2339 2234

单位是毫秒

2,大批量内存拷贝

大批量内存拷贝,用memcpy代替赋值语句

int main() { clock_t theClock=clock(); Node *p=(Node *)malloc(sizeof(Node)*M); int *p2=(int *)malloc(sizeof(int)*N*M); OUTCLOCK for(int i=0;i<M;i++)for(int j=0;j<N;j++)p2[i*N+j]=p[i].a[j]; OUTCLOCK memcpy(p2,p, sizeof(int)*N*M); OUTCLOCK return 0; }

运行结果:

0 2811 276

3,多分支语句的顺序

形如如下的代码:

if(con1)do1; else if(con2)do2; else if(con3)do3; else do4;

假设do语句里面没有continue、break、goto、return语句,那么这段代码的执行时间分为con判断时间、do语句时间两部分。

其中,无论这些分支如何调整顺序,都不影响do语句时间,所以只需要考虑con判断时间。

假设各个分支的命中概率分别为p1 p2 p3 p4,判断时间(单个con表达式的执行时间)分别为t1 t2 t3 t4

则con判断时间T=p1t1 + p2(t1+t2) + p3(t1+t2+t3) + p4(t1+t2+t3+t4)

显然当p1/t1 > p2/t2 > p3/t3 > p4/t4时,T取到最小值。

也就是说,命中率高的分支往前放,单个con表达式执行时间较长的往后放(这种比如con表达式包含了执行一个函数)

4,循环嵌套条件语句

如果循环里面有if语句,无论是对程序员还是对cpu来说,都是一个复杂的行为。

#include <stdio.h> #include "time.h" #define N 1000000 #define M 1000 int x[M],y[M]; #define OUTCLOCK \ printf("%d ",clock()-theClock); \ theClock=clock(); int main() { for(int i=0;i<M;i++)x[i]=i*i,y[i]=i*i*i+i*3+1; int d,s=0; scanf("%d",&d); clock_t theClock=clock(); for(int i=0;i<N;i++)for(int i=0;i<M;i++)if(x[i]==d)s+=y[i]; OUTCLOCK for(int i=0;i<N;i++)for(int i=0;i<M;i++)s+=((x[i]==d)?y[i]:0); OUTCLOCK return 0; }

运行结果:

250000
1770 1501

可此可见,让条件只控制数据不控制指令跳转,对于CPU来说是很友好的。

5,虚函数

虚函数比较慢的原因有两个,一是需要通过函数指针来调用,二是通常会防止内联。

所以,CRTP模式会比继承模式要快。

6,volatile

普通代码:

#include<iostream> using namespace std; int main() { char ch[80]; for(int i=0;i<80;i++)ch[i]=0; //核心代码 for(int i=0;i<80;i++)cout<<ch[i]; return 0; }

其中赋值的那一行是核心代码。

汇编:

汇编结果是5次操作,每次操作16个字节。

加了volatile的代码:

#include<iostream> using namespace std; int main() { volatile char ch[80]; for(int i=0;i<80;i++)ch[i]=0; //核心代码 for(int i=0;i<80;i++)cout<<ch[i]; return 0; }

汇编:

加了volatile的代码,汇编结果就是80次的循环了。

所以, volatile是对性能有负面影响的。

六,经验总结

1,异常性能

功能相同,代码差不多,但性能差异明显,有可能是算法写错了。

实例:杀手数独

错误代码中漏了规则,即少了DFS的剪枝条件,或许即使少了条件也有唯一答案,但搜索效率一定会降低。

2,性能优化手段总结

(来自吴咏炜老师)

3,增加Cache命中率

(1)增加Cache块大小

(2)增加Cache容量

(3)增加Cache相联度

(4)way预测

(5)编译优化

4,并行处理

(1)指令级并行

流水线、超标量、超长指令字、乱序执行

(2)向量数据并行

向量架构、多媒体SIMD指令集拓展、脉动阵列、gpu

(3)线程级并行

多处理机,多核,多线程

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/23 17:40:14

GEO跨平台适配实战:主流AI大模型的内容引用机制差异与差异化优化策略

摘要&#xff1a;多数企业在做GEO时容易陷入一个误区——“做一套内容&#xff0c;全平台分发”。但事实上&#xff0c;DeepSeek、豆包、Kimi、通义千问、文心一言等主流AI平台在信源偏好、内容评估逻辑和引用决策机制上存在显著差异。同一篇内容在A平台被高频引用&#xff0c;…

作者头像 李华
网站建设 2026/7/23 17:40:08

Docker--Ubuntu使用apt-get安装Docker

原文网址&#xff1a;Docker--Ubuntu使用apt-get安装Docker_IT利刃出鞘的博客-CSDN博客 简介 本文介绍在Ubuntu中安装Docker的方法。 1.卸载旧版本Docker 旧版本的 Docker 称为 docker 或者 docker-engine&#xff0c;使用以下命令卸载旧版本&#xff1a; sudo apt-get re…

作者头像 李华
网站建设 2026/7/23 17:32:10

静态路由综合练习

拓扑图&#xff0c;及要求如图所示.按要求划分IP地址&#xff0c;并进行标注给AR1~AR5配置网关&#xff0c;这里仅展示R1与R4给R1~R5配置环回地址&#xff0c;仅展示R1写静态路由并在R1~R4中写缺省路由导向5.5.5.0网段如图为R1~R5的路由表检擦配置进行ping通测试在R1~R4写空接口…

作者头像 李华
网站建设 2026/7/23 17:31:57

东莞自助餐排名专业的

记得十年前&#xff0c;刚来东莞的时候&#xff0c;朋友约我去吃自助餐&#xff0c;我还傻傻地问&#xff1a;“一个人去吃不了一桌子菜&#xff0c;不是亏了&#xff1f;”朋友笑我&#xff1a;“自助餐&#xff0c;是把你放进一个美食的森林里&#xff0c;让你自己去打猎。”…

作者头像 李华
网站建设 2026/7/23 17:31:19

从洛谷P5728解析多维数据比较:暴力算法到高效优化

1. 项目概述&#xff1a;从“旗鼓相当”到多维数据比较在算法竞赛和日常数据处理中&#xff0c;我们经常遇到一个看似简单却暗藏玄机的问题&#xff1a;如何从一组多维数据中&#xff0c;找出那些在多个维度上都“旗鼓相当”的个体&#xff1f;洛谷P5728这道题&#xff0c;正是…

作者头像 李华
网站建设 2026/7/23 17:30:06

Unity游戏实时翻译插件XUnity.AutoTranslator配置与优化实战指南

1. 项目概述&#xff1a;为什么我们需要游戏实时翻译&#xff1f; 作为一名独立游戏开发者&#xff0c;我经常需要测试来自全球各地的游戏Demo&#xff0c;或者研究不同语言区的热门作品。最头疼的莫过于遇到一款玩法惊艳但语言完全不通的游戏&#xff0c;那种感觉就像面对一个…

作者头像 李华