简介:这份PDF资料面向需要在Windows 11基础上搭建Ubuntu 24.04双系统的开发者与深度学习入门者,重点解决从系统安装到GPU开发环境配置的完整链路问题。内容覆盖Ubuntu 24.04安装、Nvidia驱动、CUDA、cuDNN、Anaconda、Python虚拟环境以及VS Code与PyCharm专业版等环节,并附有新手可参考的延伸链接,方便不同经验层级的读者按需取用。资源包共1个PDF文件,大小约1.74MB,以图文步骤形式呈现,便于对照操作与快速检索。目前已有17606人学习下载,说明该流程在社区中具有较高的实用参考价值。读者可借此获得一套经过实测的安装顺序与配置思路,减少驱动与CUDA版本匹配、环境变量设置等常见环节的试错成本,适合希望快速完成双系统与深度学习环境部署的技术人员。
1. 双系统不是终点,而是把 Windows 11 和 Ubuntu 24.04 的算力接上 GPU 的起点
很多人装完 Windows 11 + Ubuntu 24.04 双系统后,卡在第一步:Ubuntu 里nvidia-smi报command not found,或者装完驱动重启直接黑屏。问题不在 Ubuntu 24.04 本身,而在于它默认启用了开源的 nouveau 驱动,和 Nvidia 官方驱动冲突。这篇内容面向需要在 Ubuntu 24.04 上跑深度学习、CUDA 编译、cuDNN 推理的开发者,从分区、驱动、CUDA 到 cuDNN 一条链路走通。Windows 11 那边只需要负责分区和引导,真正吃 GPU 的活在 Ubuntu 24.04 里干。下面按「装系统 → 装驱动 → 装 CUDA → 装 cuDNN → 验证与排错」的顺序展开,每一步都给可复制的命令和参数说明。
2. Ubuntu 24.04 安装与 Windows 11 双系统分区实操
2.1 安装介质制作与 BIOS 关键设置
Ubuntu 24.04 LTS 桌面版镜像建议从官方渠道获取,用 Rufus 或 balenaEtcher 写入 U 盘。Windows 11 下用 Rufus 时,分区类型选 GPT,目标系统选 UEFI,文件系统 FAT32。写入完成后重启进 BIOS,需要确认三件事:Secure Boot 关闭或设为 Other OS、SATA 模式为 AHCI、启动顺序里 U 盘优先。
提示:Windows 11 的快速启动(Fast Startup)会锁住 NTFS 分区,安装 Ubuntu 前在「控制面板 → 电源选项 → 选择电源按钮的功能」里取消勾选「启用快速启动」,否则 Ubuntu 安装器可能看不到 Windows 分区。
2.2 分区方案与安装类型选择
在 Windows 11 的「磁盘管理」里压缩出一个未分配空间,建议至少 100GB。安装 Ubuntu 24.04 时选择「其他选项」手动分区,常见做法是:
| 挂载点 | 建议大小 | 文件系统 | 说明 |
|---|---|---|---|
| /boot/efi | 512MB | FAT32 | 与 Windows 共用已有 EFI 分区即可,不要新建 |
| / | 60GB | ext4 | 系统和软件 |
| /home | 剩余空间 | ext4 | 数据和 conda 环境 |
| swap | 16GB | swap | 内存 32GB 以下建议保留 |
如果已有 Windows 的 EFI 分区,直接挂载到/boot/efi,不要格式化。安装器会识别 Windows Boot Manager 并写入 GRUB,重启后出现系统选择菜单。
2.3 首次进入 Ubuntu 24.04 的必做配置
进入系统后先换源再更新,否则后续装驱动会卡在下载。编辑/etc/apt/sources.list.d/ubuntu.sources,把archive.ubuntu.com替换为国内镜像地址,然后执行:
sudo apt update && sudo apt upgrade -y sudo apt install -y build-essential linux-headers-$(uname -r) dkmslinux-headers-$(uname -r)是编译 Nvidia 内核模块的前提,dkms负责在内核升级后自动重编驱动。这两步不做,后面装驱动大概率报Unable to find the kernel source tree。
3. Nvidia 驱动安装:从 nouveau 屏蔽到 nvidia-smi 出结果
3.1 先屏蔽 nouveau,再谈装驱动
Ubuntu 24.04 默认加载 nouveau,直接装 Nvidia 驱动会冲突。先创建屏蔽文件:
sudo tee /etc/modprobe.d/blacklist-nouveau.conf <<'EOF' blacklist nouveau options nouveau modeset=0 EOF sudo update-initramfs -u sudo reboot重启后执行lsmod | grep nouveau,没有任何输出说明屏蔽成功。这一步是后面所有操作的地基,跳过它就会出现「装完驱动重启黑屏」的经典问题。
3.2 用 ubuntu-drivers 自动选版本
Ubuntu 24.04 自带ubuntu-drivers工具,能根据显卡型号推荐驱动版本:
sudo apt install -y ubuntu-drivers-common ubuntu-drivers devices输出里带recommended的那一行就是推荐版本,比如 RTX 4060 笔记本常见推荐nvidia-driver-550。直接安装:
sudo ubuntu-drivers autoinstall sudo reboot重启后运行nvidia-smi,能看到显卡型号、驱动版本、CUDA Version 就说明驱动层通了。注意这里的 CUDA Version 是驱动支持的最高 CUDA 版本,不是你已安装的 CUDA 版本。
3.3 手动安装 runfile 的适用场景与坑
有些场景必须用官方.run文件,比如需要特定旧版本驱动、或ubuntu-drivers推荐版本不满足要求。手动安装前必须停掉图形界面:
sudo systemctl isolate multi-user.target sudo sh NVIDIA-Linux-x86_64-*.run --dkms --no-opengl-files--dkms让驱动随内核升级自动重编,--no-opengl-files避免覆盖系统 OpenGL 库导致桌面起不来。安装过程中如果提示是否更新 X 配置,选否。装完sudo systemctl set-default graphical.target再重启。
注意:手动 runfile 安装后,
apt upgrade升级内核可能导致驱动失效,需要重新运行安装文件。生产环境更推荐ubuntu-drivers或apt方式。
4. CUDA 与 cuDNN 安装:版本匹配是唯一真理
4.1 先查驱动支持的 CUDA 上限
nvidia-smi右上角的 CUDA Version 是驱动能支持的最高版本。比如显示 12.4,那你可以装 CUDA 12.4 及以下,装 12.6 会报CUDA driver version is insufficient。查完再决定装哪个版本,不要盲目追新。
4.2 用官方仓库装 CUDA Toolkit
以 CUDA 12.4 为例,先下载并安装 keyring 和仓库配置:
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb sudo dpkg -i cuda-keyring_1.1-1_all.deb sudo apt update sudo apt install -y cuda-toolkit-12-4装完配置环境变量,编辑~/.bashrc追加:
export PATH=/usr/local/cuda-12.4/bin:$PATH export LD_LIBRARY_PATH=/usr/local/cuda-12.4/lib64:$LD_LIBRARY_PATHsource ~/.bashrc后执行nvcc -V,输出release 12.4即成功。PATH决定nvcc命令能否找到,LD_LIBRARY_PATH决定运行时能否加载libcudart.so,两个都不能少。
4.3 cuDNN 安装与版本对应关系
cuDNN 必须和 CUDA 版本严格对应。CUDA 12.4 对应 cuDNN 9.x。用 apt 安装最省事:
sudo apt install -y cudnn9-cuda-12如果下载的是 tar 包,解压后手动拷贝:
tar -xvf cudnn-linux-x86_64-9.x.x.x_cuda12-archive.tar.xz sudo cp cudnn-*-archive/include/cudnn*.h /usr/local/cuda-12.4/include/ sudo cp cudnn-*-archive/lib/libcudnn* /usr/local/cuda-12.4/lib64/ sudo chmod a+r /usr/local/cuda-12.4/include/cudnn*.h /usr/local/cuda-12.4/lib64/libcudnn*验证 cuDNN 版本:
cat /usr/local/cuda-12.4/include/cudnn_version.h | grep CUDNN_MAJOR -A 2提示:热词里常出现的「cudnn 和 cuda13.0」这类组合,务必先确认驱动是否支持 CUDA 13。驱动版本不够时,降 CUDA 比升驱动更稳妥。
4.4 conda 环境下的 CUDA 与系统 CUDA 共存
很多人用 conda 装 PyTorch 时会自带一份 CUDA runtime,和系统 CUDA 并存。原则是:系统 CUDA 负责nvcc编译,conda 里的cudatoolkit负责运行时。用conda install pytorch pytorch-cuda=12.4 -c pytorch -c nvidia时,conda 会拉取匹配的 runtime,不需要和系统版本完全一致,但大版本要对齐。
5. 验证、排错与多版本 CUDA 切换技巧
5.1 三层验证:驱动、CUDA、cuDNN
装完不要只看nvidia-smi。按下面三层依次验证:
# 第一层:驱动 nvidia-smi # 第二层:CUDA 编译器 nvcc -V # 第三层:cuDNN 运行时 python -c "import torch; print(torch.cuda.is_available(), torch.backends.cudnn.version())"torch.cuda.is_available()返回True且 cuDNN 版本号非空,才算整条链路打通。如果nvidia-smi正常但 PyTorch 报False,多半是 conda 里的 CUDA runtime 和驱动不匹配。
5.2 常见报错对照表
| 报错信息 | 原因 | 处理 |
|---|---|---|
command not found: nvidia-smi | 驱动未装或 nouveau 未屏蔽 | 回第 3 章重装 |
| 重启后黑屏 | nouveau 冲突或 OpenGL 被覆盖 | 进 recovery 模式卸载重装 |
CUDA driver version is insufficient | CUDA 版本高于驱动支持 | 降 CUDA 或升驱动 |
libcudnn.so not found | LD_LIBRARY_PATH 未配 | 检查环境变量 |
gzip: stdin: invalid compressed data | 下载包损坏 | 重新下载并校验 md5 |
5.3 多版本 CUDA 切换的软链接方案
同时装 CUDA 11.8 和 12.4 时,用软链接切换默认版本:
sudo rm -rf /usr/local/cuda sudo ln -s /usr/local/cuda-12.4 /usr/local/cuda需要切回 11.8 时把链接指向cuda-11.8,再更新~/.bashrc里的PATH和LD_LIBRARY_PATH。这样不同项目可以按需切换,不用反复卸载重装。切换后记得source ~/.bashrc并重新验证nvcc -V。
5.4 内核升级后驱动失效的预防
Ubuntu 24.04 的apt upgrade可能升级内核,导致 Nvidia 模块加载失败。用 DKMS 安装的驱动会自动重编,但手动 runfile 安装的不会。预防办法是锁定内核版本:
sudo apt-mark hold linux-image-$(uname -r) linux-headers-$(uname -r)需要升级内核时先unhold,升级后重新装驱动再hold。这个习惯能省掉很多「昨天还好好的,今天开机黑屏」的排查时间。
本文还有配套的精品资源,点击获取