AI导航

Qwen3 MLX 与 LLaMA3 MLX 性能对比:谁更适合本地推理?

AI资讯
2 min read
132 次阅读

Qwen3 模型推出 MLX 格式:支持 4bit/6bit/8bit/BF16 多级量化,优化 Apple Silicon 体验

2025 年 6 月,阿里巴巴 Qwen 团队宣布正式发布 Qwen3 系列模型的 MLX 格式版本。此次发布支持 4bit、6bit、8bit 与 BF16 四种量化级别,全面适配 Apple Silicon 平台,满足不同精度与性能需求。

什么是 MLX?

MLX 是 Apple 官方推出的开源推理框架,专为 macOS 和 Apple Silicon 芯片优化,具备以下特点:

  • 轻量级无依赖:不依赖 PyTorch 或 CUDA;
  • 原生支持 Apple 硬件加速;
  • 快速部署与加载,适合本地推理。

MLX 框架已被广泛用于 LLM 本地部署,尤其适合 M1、M2、M3 系列芯片用户。

Qwen3 MLX 版本亮点

此次 Qwen3 MLX 发布涵盖从 Qwen3-0.5B 到 Qwen3-72B,甚至包括 MoE 架构(如 Qwen3-MoE-A2.7B)。主要特性包括:

  • 多量化级别可选:4bit/6bit/8bit/BF16,灵活应对不同硬件资源;
  • 完整推理模板支持:包含对话格式、system prompt 与思维模式切换;
  • 加载速度快、显存占用低:8bit 与 4bit 在本地表现出色;
  • 模型性能优异:在 MMLU、GSM8K、HumanEval 等基准测试中成绩突出。

使用示例:快速上手 Qwen3-MLX

用户可通过 Hugging Face 或 ModelScope 下载模型,以下为基本推理代码:

from mlx_lm import load, generate

model, tokenizer = load("mlx-community/Qwen3-7B-8bit")  # 替换为任意量化版本
prompt = "请介绍一下 Qwen3 的主要特点。"
response = generate(model, tokenizer, prompt=prompt)
print(response)

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。