news 2026/9/20 15:55:46

Llama Models 从安装到跑通:新手快速跑起 Llama 4 实战指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Llama Models 从安装到跑通:新手快速跑起 Llama 4 实战指南

Llama Models 从安装到跑通:新手快速跑起 Llama 4 实战指南

【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models

Llama Models 是 Meta 官方的 Llama 模型工具库:模型权重、分词器(把文本切成模型能读的 token 的组件)、llama-model命令行下载工具、以及能直接运行的推理代码,全都在一个仓库里。它覆盖 Llama 2 到 Llama 4 共 7 个模型家族,其中最新的 Llama 4 原生支持图像输入,并且用混合专家(MoE,一种只激活部分参数的网络结构)把推理成本压了下来。

这篇文章不讲宏大概念,只回答一个问题:拿到这个仓库之后,我怎么最快看到模型输出的第一句话?

🧰 先搞清它能帮你解决什么

下载一个大模型,麻烦通常不止"下载"本身:权重散落在不同渠道、下载链接要审批、下完还得自己搭推理代码。这个仓库把整条链路打包了:

  • 一套llama-modelCLI:查模型、下权重、校验完整性、删模型、查提示词格式,一共 7 个命令。装包时会自动注册,装完就能敲。
  • 可直接跑的推理代码models/llama3/scripts/models/llama4/scripts/里就有示例脚本,不用自己写加载逻辑。
  • 每个模型的完整档案:模型卡、使用政策(USE_POLICY)、许可证分目录放好,比如 Llama 4 模型卡。

7 个 CLI 命令,够用一辈子

llama-model list列出最新可用模型,加--show-all能看到所有历史版本;describe -m 模型ID查看某个模型的详细信息;download从 Meta 或 Hugging Face 下载;verify-download校验文件完整性;remove -m 模型ID删掉已下载的模型;prompt-format -m 模型ID显示该模型的提示词格式(不同模型的对话模板长得不一样,写应用前值得看一眼)。任何命令加--help都有详细帮助。

权重下载后放在哪

所有权重默认落在~/.llama/checkpoints/模型ID/目录下。后面跑推理时要指定这个路径,记住它就行。

⏱️ 5 分钟搭好环境:安装与下载权重

安装 CLI 并查看模型列表

Python 需要 3.10 及以上版本。三条命令,从空环境到开始下载:

pip install llama-models llama-model list llama-model download --source meta --model-id Llama-4-Scout-17B-16E-Instruct

list的输出会告诉你当前最新的模型 ID。想跑别的版本,先把 ID 换成你要的。

拿到签名链接,完成下载

直接download之前,得先在 Meta Llama 官网读并同意许可证,审批通过后邮件里会收到一个签名 URL,下载时照着提示粘贴进去即可。两个注意点:

  1. 链接 24 小时内有效,且有下载次数上限,过期或超次后会报403: Forbidden——重新申请一个链接就能解决,别慌。
  2. 想跑推理而不只是下权重,需要 clone 仓库装完整依赖:
git clone https://gitcode.com/GitHub_Trending/ll/llama-models cd llama-models pip install .[torch]

.[torch]会额外装 PyTorch、fairscale(模型并行库)、fbgemm-gpu-genai 这些推理所需的包;不跑推理只玩 CLI,第一步的pip install llama-models就够了。

📦 七个模型家族,该挑哪一个

仓库里每个版本的模型卡、许可证、使用政策都分目录存放。先把全家福放这儿:

模型发布日期参数规模上下文长度分词器
Llama 22023/7/187B, 13B, 70B4KSentencepiece
Llama 32024/4/188B, 70B8K基于 TikToken
Llama 3.12024/7/238B, 70B, 405B128K基于 TikToken
Llama 3.22024/9/251B, 3B128K基于 TikToken
Llama 3.2-Vision2024/9/2511B, 90B128K基于 TikToken
Llama 3.32024/12/470B128K基于 TikToken
Llama 42025/4/5Scout-17B-16E, Maverick-17B-128E10M, 1M基于 TikToken

按场景挑,别按参数挑

  • 设备内存紧张、想本地玩:Llama 3.2 的 1B 和 3B 是全场最小的两个,还带 128K 上下文。
  • 要处理超长文档:Llama 3.1/3.2 全系 128K;更夸张的是 Llama 4 Scout,上下文直接到 10M(一千万 token)。
  • 要看图:老路线选 Llama 3.2-Vision(11B/90B,图像经视觉编码器接入文本模型);新路线直接用 Llama 4,文本加图像原生输入。
  • Llama 4 的两个型号:Scout 激活 17B、总参数 109B,上下文 10M;Maverick 激活 17B、总参数 400B,上下文 1M,用了约 22T token 训练。两者都支持 12 种语言,知识截止 2024 年 8 月。

一句话:90% 的新项目从Llama-4-Scout-17B-16E-Instruct开始就对了。

🚀 跑推理:单机、多卡与量化

跑通 Llama 4 的对话推理

前提:已 clone 仓库并装好.[torch]依赖。Llama 4 系列在 bf16 全精度下推理至少需要 4 张 GPU,官方示例脚本是这么跑的:

NGPUS=4 CHECKPOINT_DIR=~/.llama/checkpoints/Llama-4-Scout-17B-16E-Instruct PYTHONPATH=$(git rev-parse --show-toplevel) \ torchrun --nproc_per_node=$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS

注意两点:chat_completion脚本只适用于 Instruct(对话)模型;如果下的是 Base(未指令微调)模型,改用models.llama4.scripts.completion脚本,并更新CHECKPOINT_DIR路径。示例脚本还会加载models/resources/dog.jpg和下面这张图作为输入,方便你直接验证多模态效果:

量化:FP8 两张卡,Int4 一张卡

显存不够就开混合精度量化。在上面的命令末尾加一个参数即可:--quantization-mode fp8_mixed--quantization-mode int4_mixed。前者把部分权重压成 FP8(8 位浮点)、激活保持 bfloat16;后者把部分权重压成 Int4(4 位整数)。以 Llama-4-Scout-17B-16E-Instruct 为例,80GB 显存的 GPU 需求:

精度模式所需 GPU(80GB)
bf16 全精度4 张
fp8_mixed2 张
int4_mixed1 张

说白了,单卡 80GB 也能跑 Llama 4,代价是精度损失很小。想要更灵活的推理后端(比如接入其他提供商),官方推荐看 Llama Stack 工具集。

🔍 底下一半:MoE、多模态与量化实现

混合专家为什么让 Llama 4 又强又省

普通 Transformer 每层的前馈网络对所有参数一视同仁;MoE 把它换成一组"专家",每个 token 只由路由选中的少数专家处理。Llama 4 Scout 总参数 109B,但每个 token 实际只激活 17B——参数容量接近大模型,计算成本接近小模型。仓库里models/llama4/moe.pymodels/llama4/ffn.py就是这部分实现。

两代多模态方案

Llama 3.2-Vision 的做法是"加装":在 Llama 3.1 文本模型旁边配一个独立训练的视觉适配器,用一系列交叉注意力层把图像编码喂给语言模型。Llama 4 则是 early fusion(早期融合),图像和文本从第一层就一起进入主干网络,属于真正的原生多模态。3.2-Vision 的视觉提示词格式可以参考models/llama3_2/vision_prompt_format.md

量化代码在哪

fp8_mixed/int4_mixed的加载逻辑集中在 量化模块,核心入口是loader.py里的convert_to_quantized_model:它把 checkpoint 里的全精度权重按需转换成 FP8 或 Int4 存储格式,再换掉对应层的矩阵乘法实现。想研究细节,直接读这里比读博客快。

🛠️ 常见坑与排查

下载报 403 Forbidden

九成是签名链接过期或下载次数用完了。回邮件里重新申请一个新链接即可,不用重新走审批。

Base 和 Instruct 脚本搞混

同一个模型家族,Instruct 版配chat_completion脚本,Base 版配completion脚本。用错的话对话模板不匹配,输出会很怪。拿不准就先跑llama-model prompt-format -m 模型ID看一眼模板长什么样。

显存或卡数不够

按上一条的量化表降级:4 卡 → 2 卡(fp8_mixed)→ 1 卡(int4_mixed)。再不够就换小一号的模型,比如 Llama 3.2 的 1B/3B。另外商用前务必读一下对应模型的 使用政策,各版本限制条款不完全一样。

跑通第一句话之后,建议先花十分钟通读一遍所用模型的模型卡和 USE_POLICY,再谈接入生产。仓库里models/llama4/scripts/的示例脚本是最好的起点——改几个参数,它就是你的第一版推理服务。

【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 15:49:07

加工工艺复习指南:铸造、锻压、焊接与切削加工核心考点

简介:北航《加工工艺》期末考试试卷PDF,面向机械设计制造及其自动化、飞行器制造等专业的本科生,也适合考研复试或企业新员工培训时用作自测。试卷围绕金属切削、铸造、焊接、塑性成形四大类工艺展开,并延伸至表面处理、装配工艺与…

作者头像 李华
网站建设 2026/9/20 15:45:00

RapidOCR 快速上手指南:3 步装好开源 OCR 文字识别工具

RapidOCR 快速上手指南:3 步装好开源 OCR 文字识别工具 【免费下载链接】RapidOCR 📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch. 项目地址: https://gitcode.c…

作者头像 李华