GGUF vs GPTQ vs AWQ vs EXL2: LLM Model Formats Explained (2026) - MarkTechPost

从GGUF到EXL3:2026年本地LLM模型格式选型指南
2026年,GGUF、GPTQ、AWQ、EXL2/EXL3四种主流本地大语言模型格式格局清晰:GGUF凭借Georgi Gerganov设计的单文件自包含结构,成为Ollama、LM Studio的跨平台默认;ExLlamaV3在7月14日发布v1.0.0后取代EXL2;MIT Han Lab的AWQ成为vLLM生产环境默认4-bit格式;GPTQ逐渐式微。选型取决于硬件与推理引擎。

2026年7月14日,ExLlamaV3发布v1.0.0稳定版,解码速度在部分配置下接近翻倍。这个版本让EXL3格式正式取代EXL2,成为NVIDIA显卡上本地模型推理的新选择。而与此同时,Ollama和LM Studio用户每天加载的默认格式仍是GGUF——同一台电脑上,两种截然不同的模型格式生态正在并行演进。

GGUF:通吃CPU与Apple Silicon的事实标准

由Georgi Gerganov(llama.cpp作者)开发的GGUF,用单文件自包含设计解决了模型分发的核心痛点:权重、分词器、元数据全部封装在一个文件中,既支持CPU推理,也支持Apple Silicon和跨设备分层卸载。这种灵活性让GGUF成为Ollama和LM Studio的默认格式,Q4_K_M则是最常用的量化等级。对于想在MacBook上跑模型或部署边缘设备的开发者,GGUF是门槛最低的起点。

GPTQ:存量多,新部署减少

GPTQ由IST Austria与社区共同开发,基于二阶Hessian信息进行逐层后训练量化(PTQ),主打GPU推理。vLLM和ExLlama都对其提供支持,Hugging Face上也沉淀了大量GPTQ模型。但一个明显的变化是,新模型发布时AWQ量化版往往更早出现、质量更好,GPTQ正在被AWQ取代、逐渐式微。从行业角度看,新部署减少已是事实,GPTQ更多存在于维护存量项目的场景中。

AWQ:vLLM生产环境的默认选择

AWQ来自MIT Han Lab,核心思路是激活感知量化——通过保护"显著权重"来降低量化损失。在4-bit精度下,AWQ的质量优于GPTQ,同时保持了较高的推理吞吐量,这让它成为vLLM生产GPU服务的默认4-bit格式。对运营多用户推理服务的团队来说,AWQ在质量和吞吐量之间取得了平衡。

EXL2到EXL3:NVIDIA单卡的性能接力

EXL2由turboderp(ExLlamaV2)开发,采用可变混合比特率,配合定制CUDA内核,在消费级NVIDIA GPU上实现了极快的推理速度。2026年7月14日,ExLlamaV3 v1.0.0发布后,EXL3以trellis/codebook量化方案在同比特率下实现了优于EXL2的质量,部分配置解码速度接近翻倍,正式接替EXL2成为NVIDIA单卡场景的首选。Hugging Face上已有大量EXL3模型,包括Llama-3.3-70B EXL3与GLM-5.3 EXL3。后者是753B MoE模型,2026年9月已出现3-bit量化版本,并搭配4×DGX Spark形成服务方案。从EXL2到EXL3的迭代节奏来看,可以推断turboderp对NVIDIA单卡性能的深耕仍在继续。

FP4:Blackwell时代的前沿信号

在GGUF、EXL3和AWQ之外,FP4(MXFP4/NVFP4)正在成为Blackwell硬件上的新前沿,并且已经开始进入GGUF生态。短期看,这不会撼动三种主流格式的既有格局;长期看,一旦FP4生态成熟,模型格式版图可能会再次改写。对开发者而言,眼下最实际的做法仍然是按硬件和场景选格式:跨平台部署选GGUF,NVIDIA单卡追求极限性能选EXL3,vLLM多用户生产服务选AWQ,GPTQ则留给存量项目继续运转。

参考资料

  1. 开源模型量化与部署工具链生态:第三周工具全景选型与评测复盘_python_雷帝木木-AMD开发者中国社区 - DevPress
  2. Model Formats Explained: GGUF vs GPTQ vs AWQ vs EXL2 -
  3. Model Conversion | turboderp-org/exllamav3 | DeepWiki - DeepWiki
  4. GGUF vs GPTQ vs AWQ vs EXL2: Model Quantization Format Comparison -
  5. drowzeys/keys-GLM-5.3-EXL3 · Hugging Face - Hugging Face
  6. 8GB内存跑AI:GGUF量化模型本地部署实战指南-CSDN博客 - CSDN博客
  7. Llama-3.3-70B-Instruct EXL3 5.0bpw h6 - Hugging Face
  8. GGUF | InsiderLLM -
  9. ExLlamaV3 v1.0.0 Just Rewrote the Rules for Local LLM Inference, NVIDIA GPU Owners Rejoice - Banandre
  10. LLM Quantization Explained: GGUF vs AWQ vs GPTQ — The Complete 2026 Guide - Fungies.io
  11. What Is GGUF? Local AI Model Formats Explained (GGUF, safetensors, MLX, GPTQ, AWQ) - Inventive HQ
  12. Quick Start Guide | turboderp-org/exllamav3 | DeepWiki - DeepWiki
  13. GGUF vs GPTQ vs AWQ: Which Quantization Format Should You Actually Use? - DEV Community
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。