lift-oQ4 vs lift-oQ8 vs bf16:MLX社区7大量化版本怎么选最合适
【免费下载链接】lift-oQ4项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ4
lift-oQ4 是 MLX 社区针对文档抽取视觉大模型 lift(9B Qwen3.5)推出的数据驱动混合精度量化版本,平均每个权重仅约 4.6 比特,把近 18GB 的 bf16 全精度模型压缩到 5.6GB,在 Apple Silicon 上能跑到约 100 tokens/s。面对 lift-bf16、lift-oQ8、lift-oQ6、lift-oQ5、lift-oQ4、lift-oQ3.5、lift-oQ3 这 7 个量化版本,新手往往纠结:到底该选哪个?本文用一张对比表加四个典型场景,帮你快速锁定最合适的那一个。
一、lift 是什么?为什么会有 7 个版本?
lift 是一个专门做结构化抽取的视觉语言模型(VLM):输入 PDF、发票、合同或表格截图,输出符合 JSON Schema 的规整数据,相当于"图片/文档 → 结构化 JSON"的利器。它基于 Qwen3.5 架构、约 90 亿参数,支持图文混合输入,模型结构与说明可参考 README.md 和 config.json。
MLX 社区把它转换成 Apple Silicon 原生可运行的格式,并一口气发布从 bf16 全精度到 oQ3 的 7 个版本,用来覆盖不同内存配置的 Mac 用户——这也是本次对比的由来。
二、7 个版本一表看懂:体积、内存、速度
| 版本 | 量化方式 | 平均位数 | 文件大小 | 峰值内存 | 生成速度 |
|---|---|---|---|---|---|
| lift-bf16 | 全精度 bf16 | 16 bit | 18 GB | 19.9 GB | 31 t/s |
| lift-oQ8 | oQ 混合精度 | ≈8.6 | 9.7 GB | 12.3 GB | 58 t/s |
| lift-oQ6 | oQ 混合精度 | ≈6 | 7.7 GB | 9.4 GB | 73 t/s |
| lift-oQ5 | oQ 混合精度 | ≈5 | 6.7 GB | 8.4 GB | 83 t/s |
| lift-oQ4 | oQ 混合精度 | ≈4.6 | 5.6 GB | 7.2 GB | 100 t/s |
| lift-oQ3.5 | oQ 混合精度 | ≈4.0 | 4.9 GB | 6.5 GB | 109 t/s |
| lift-oQ3 | oQ 混合精度 | ≈3.5 | 4.6 GB | 6.2 GB | 119 t/s |
以上数据来自 README.md,是在单张发票抽取场景下的实测参考值(M5 Max 128GB),并非严谨基准,仅供选型参考。
三、oQ 量化是什么?为什么 oQ4 只有 4.6 比特?
oQ 来自 oMLX 工具链,它并不是简单地把所有权重压到同一个位数,而是数据驱动、逐层分配精度:对抽取结果影响大的层保留更多比特(比如 5bit),不敏感的层压缩到 4bit,最终整体平均约 4.6 比特。这种"好钢用在刀刃上"的策略,让 lift-oQ4 在体积缩小到全精度约三分之一的同时,尽可能保住字段抽取的准确率。逐层量化配置就写在 config.json 的quantization字段里;权重分片情况则记录在 model.safetensors.index.json,共两个 safetensors 文件、约 6GB,感兴趣的可以自己翻阅。
四、怎么选?4 个典型场景对号入座
场景 1:追求极致精度、内存管够 → 选 lift-bf16
如果你跑在 64GB 以上内存的 M 系列 Max/Ultra 上,且要处理最难的报表、手写文档,bf16 全精度是最稳妥的选择。代价是 19.9GB 的峰值内存,不是所有 Mac 都扛得住。
场景 2:精度优先、又要能本地跑 → 选 lift-oQ8
oQ8 平均 8.6 比特,质量最接近全精度,体积却只有 9.7GB。适合 16GB 以上内存、把精度放在第一位的用户。
场景 3:日常发票/合同抽取,最推荐 lift-oQ4 ⭐
这是性价比甜点位:5.6GB 文件、7.2GB 峰值内存,16GB 内存的 MacBook 也能流畅运行,速度高达 100 t/s。对常见的发票、合同、收据结构化抽取,oQ4 的精度损失几乎可以忽略,大多数个人开发者选它准没错。
场景 4:老款 Mac / 8GB 内存,只要快 → 选 lift-oQ3.5 或 lift-oQ3
oQ3 峰值内存只要 6.2GB,速度冲到 119 t/s,低配机器也能跑。但位数越低,对模糊、复杂版式文档的抽取质量下降越明显,建议先用简单文档验证效果再上线。
五、三步上手:在 Mac 上跑起 lift-oQ4
- 装依赖:通过 mlx-vlm 提供推理与 OpenAI 兼容服务能力;
- 单图抽取:用一条命令直接生成 JSON;
- 结构化输出:起服务后配合 JSON Schema,保证返回结果合法、类型正确。
命令行单图抽取:
uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-oQ4 \ --image invoice.png \ --prompt "Extract the invoice as JSON." \ --max-tokens 800OpenAI 兼容服务:
uvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-oQ4 --port 8080服务端通过 llguidance 在解码阶段强制执行 JSON Schema,输出一定是合法且符合类型的 JSON,非常适合对接自动化流程。完整的 Python 调用示例(含 base64 图片与 schema 定义)见 README.md。
六、一个必须知道的坑:eos 修复
上游模型只设置了248044一个结束符,而对话轮次实际以<|im_end|>(token 248046)收尾——不修复的话,MLX 服务端会一直生成、停不下来。MLX 社区版已在 generation_config.json 中把eos_token_id修复为[248044, 248046],直接使用即可;如果你自行重新转换模型,务必记得补上这个修复。图文输入模板可以对照 chat_template.jinja 查看。
七、总结:一张图记住选择逻辑
| 你的需求 | 推荐版本 |
|---|---|
| 精度天花板 + 大内存 | lift-bf16 |
| 精度优先 + 16GB 内存 | lift-oQ8 |
| 日常抽取 + 速度质量兼顾 | lift-oQ4(首选) |
| 低配机器 + 极致速度 | lift-oQ3 / lift-oQ3.5 |
需要本地部署时,可通过 git clone 拉取模型仓库:
git clone https://gitcode.com/hf_mirrors/mlx-community/lift-oQ4配合 mlx-vlm 即可在 Apple Silicon 上离线运行。选型没有绝对答案,先拿一张你自己的发票跑一遍,比任何参数表都直观。😉
【免费下载链接】lift-oQ4项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ4
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考