
实测对比lift-oQ3.5 在不同 Apple Silicon 设备上的内存占用与生成速度【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5lift-oQ3.5 是一款专为 PDF/图片结构化提取设计的 9B 多模态大模型qwen3_5 架构经过 oMLX 混合精度量化后模型文件仅约 4.9GB特别适合在 Mac 本地离线运行。本文结合官方基准数据与 Apple Silicon 各代芯片的内存带宽特性实测对比 lift-oQ3.5 在不同 M 系列设备上的内存占用与生成速度帮你判断手里的 Mac 能不能流畅跑起来以及哪款设备性价比最高。什么是 lift-oQ3.5专为 PDF 转 JSON 提取设计的轻量多模态模型lift-oQ3.5 是社区对 Datalab 开源权重lift9B 参数的 MLX 量化版本核心能力是结构化提取输入一张发票、合同或表格图片直接输出符合你定义的 JSON Schema 的数据例如invoice_number、total、line_items等字段。它有三个值得一提的技术特点混合注意力架构32 层 Transformer 中 24 层采用线性注意力linear attention仅 8 层为全注意力KV Cache 占用大幅下降长文档更省内存见 config.json 中的layer_types。⚖️逐层混合精度量化采用数据驱动的 oQ 量化不同层分配不同位宽3~6 bits整体约 4.0 bits/weight兼顾体积与精度。单文件即用权重分为 2 个分片总大小 5.25GB约 4.9GB配合 model.safetensors.index.json 即可加载。 官方给出的质量参考上游 FP16 版 lift 在 Datalab 225 份文档基准上达到 90.2% 字段提取准确率本系列各量化版均能正确提取测试发票。实测方法同一张发票测量两项关键指标本次对比围绕两个核心指标展开指标说明测量方式 内存占用模型加载 推理时的峰值内存活动监视器 /memory_pressure⚡ 生成速度每秒生成的 token 数t/smlx-vlm 运行日志测试任务统一为单张发票图片 → JSON 提取--max-tokens 800保证不同设备间的可比性。⚠️ 说明官方实测数据6.5GB 峰值内存、109 t/s来自 MacBook Pro M5 Max 128GB/40 核 GPU其余设备数据为依据 Apple 官方内存带宽规格换算的估算值用于建立大致预期实际以你设备为准。Apple Silicon 内存占用实测8GB 到 128GB 设备表现一览内存占用是 Mac 用户最关心的问题——毕竟 Mac 的内存无法扩展。综合模型体积4.9GB与官方实测峰值6.5GB各内存档位的表现如下设备内存系统占用后可用运行 lift-oQ3.5建议8GB约 5~6GB⚠️ 勉强可用短文档可行需关闭浏览器等大内存应用长文档易 OOM16GB约 13GB✅ 舒适运行日常提取无压力可同时开 server24GB/32GB约 20GB✅ 轻松运行长文档、多页 PDF 无忧64GB/128GB充足✅ 完全无压力可同时跑多个模型或大并发请求为什么这么省内存主要归功于三点4.9GB 的小体积权重对比 bf16 原版18GB、峰值内存 19.9GB量化后内存需求直接砍掉约 2/3线性注意力省 KV Cache24 层线性注意力几乎不随序列长度线性膨胀缓存长文档友好视觉编码器轻量27 层视觉塔处理后仅注入有限的图像 token不会撑爆显存。结论16GB 是舒适门槛8GB 也能跑但很勉强。如果你手头是 8GB 老款 M1/M2建议先用短文档测试。生成速度实测从 M1 到 M5 Max每秒能生成多少 tokenMLX 推理速度主要受内存带宽制约Apple Silicon 统一内存架构下权重在 GPU 与内存间流动的带宽即上限。结合各芯片官方带宽推算结果如下芯片内存带宽估算速度实际体验M168 GB/s约 12 t/s慢适合偶尔提取M1 Pro200 GB/s约 36 t/s可用M1 Max400 GB/s约 73 t/s流畅M2100 GB/s约 18 t/s较慢M2 Pro200 GB/s约 36 t/s可用M2 Max400 GB/s约 73 t/s流畅M3100 GB/s约 18 t/s较慢M3 Pro150 GB/s约 27 t/s一般M3 Max400 GB/s约 73 t/s流畅M4120 GB/s约 22 t/s较慢M4 Pro273 GB/s约 50 t/s流畅M4 Max546 GB/s约 99 t/s飞快M5 Max约 600 GB/s109 t/s官方实测极速规律很明显速度与带宽几乎成正比。M5 Max 相比 M1 快约 9 倍同为 Max 芯片的 M1/M2/M3 Max 速度接近带宽均为 400 GB/s说明老款高配 Mac 依然能打而新款基础版 M 系列提升有限。800 token 的发票提取任务M5 Max 约 7 秒完成M1 基础版则需要约 67 秒——差距一目了然。⚡量化等级横向对比为什么 oQ3.5 是甜点位同一个模型的 oQ 系列变体官方在 M5 Max 上的实测更能说明量化带来的收益变体位宽文件大小峰值内存生成速度lift-bf1616 bpw18 GB19.9 GB31 t/slift-oQ8≈8.69.7 GB12.3 GB58 t/slift-oQ6≈67.7 GB9.4 GB73 t/slift-oQ5≈56.7 GB8.4 GB83 t/slift-oQ4≈4.65.6 GB7.2 GB100 t/slift-oQ3.5本文≈4.04.9 GB6.5 GB109 t/slift-oQ3≈3.54.6 GB6.2 GB119 t/s从 bf16 到 oQ3.5内存占用下降约 67%、速度提升约 3.5 倍而简单文档提取精度几乎无损。再往下到 oQ3 虽然更快但对更难的对抗性文档精度风险会上升——所以oQ3.5 是速度、体积、精度三者平衡的甜点位。相关数据详见 README.md。如何在自己的 Mac 上复现测试mlx-vlm 部署指南只要你的 Mac 是 Apple SiliconM1 及以上就能在几分钟内跑起来无需 GPU 集群方式一命令行直接生成uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-oQ3.5 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800方式二启动 OpenAI 兼容服务推荐生产使用uvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-oQ3.5 --port 8080服务启动后用 OpenAI SDK 发送图片即可response_format支持 JSON Schema 约束输出保证合法且类型正确特别适合自动化票据处理。️重要提示eos 修复本仓库的 generation_config.json 已设置eos_token_id: [248044, 248046]。上游只设置了248044但对话结束符|im_end|对应248046若不修复MLX server 会一直生成停不下来、刷屏|im_end|。如果你自行重新转换请务必重新应用该修复。如需基于本仓库二次开发可克隆git clone https://gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5总结与选购建议综合内存占用与生成速度给出以下选购/使用建议8GB 基础版 M1/M2能跑但慢约 12~18 t/s适合偶尔提取一两张票据记得关闭其他应用16GB 的 M1 Pro/M2 Pro 及以上最均衡的选择30 t/s日常文档提取完全够用M4 Pro / M4 Max 及以上50~100 t/s适合批量处理或部署为本地 API 服务M5 Max 128GB官方基准设备6.5GB 峰值内存 109 t/s堪称文档提取利器。一句话总结lift-oQ3.5 用不到 5GB 的模型换来了 100 t/s 的提取速度是目前在 Apple Silicon 上做本地 PDF/图片结构化提取的最佳选择之一——从 8GB 入门机到 128GB 顶配都能各取所需。【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考