从GGUF到EXL3:2026年本地LLM模型格式选型指南
2026年,GGUF、GPTQ、AWQ、EXL2/EXL3四种主流本地大语言模型格式格局清晰:GGUF凭借Georgi Gerganov设计的单文件自包含结构,成为Ollama、LM Studio的跨平台默认;ExLlamaV3在7月14日发布v1.0.0后取代EXL2;MIT Han Lab的AWQ成为vLLM生产环境默认4-bit格式;GPTQ逐渐式微。选型取决于硬件与推理引擎。
2026年7月14日,ExLlamaV3发布v1.0.0稳定版,解码速度在部分配置下接近翻倍。这个版本让EXL3格式正式取代EXL2,成为NVIDIA显卡上本地模型推理的新选择。而与此同时,Ollama和LM Studio用户每天加载的默认格式仍是GGUF——同一台电脑上,两种截然不同的模型格式生态正在并行演进。
由Georgi Gerganov(llama.cpp作者)开发的GGUF,用单文件自包含设计解决了模型分发的核心痛点:权重、分词器、元数据全部封装在一个文件中,既支持CPU推理,也支持Apple Silicon和跨设备分层卸载。这种灵活性让GGUF成为Ollama和LM Studio的默认格式,Q4_K_M则是最常用的量化等级。对于想在MacBook上跑模型或部署边缘设备的开发者,GGUF是门槛最低的起点。
GPTQ由IST Austria与社区共同开发,基于二阶Hessian信息进行逐层后训练量化(PTQ),主打GPU推理。vLLM和ExLlama都对其提供支持,Hugging Face上也沉淀了大量GPTQ模型。但一个明显的变化是,新模型发布时AWQ量化版往往更早出现、质量更好,GPTQ正在被AWQ取代、逐渐式微。从行业角度看,新部署减少已是事实,GPTQ更多存在于维护存量项目的场景中。
AWQ来自MIT Han Lab,核心思路是激活感知量化——通过保护"显著权重"来降低量化损失。在4-bit精度下,AWQ的质量优于GPTQ,同时保持了较高的推理吞吐量,这让它成为vLLM生产GPU服务的默认4-bit格式。对运营多用户推理服务的团队来说,AWQ在质量和吞吐量之间取得了平衡。
EXL2由turboderp(ExLlamaV2)开发,采用可变混合比特率,配合定制CUDA内核,在消费级NVIDIA GPU上实现了极快的推理速度。2026年7月14日,ExLlamaV3 v1.0.0发布后,EXL3以trellis/codebook量化方案在同比特率下实现了优于EXL2的质量,部分配置解码速度接近翻倍,正式接替EXL2成为NVIDIA单卡场景的首选。Hugging Face上已有大量EXL3模型,包括Llama-3.3-70B EXL3与GLM-5.3 EXL3。后者是753B MoE模型,2026年9月已出现3-bit量化版本,并搭配4×DGX Spark形成服务方案。从EXL2到EXL3的迭代节奏来看,可以推断turboderp对NVIDIA单卡性能的深耕仍在继续。
在GGUF、EXL3和AWQ之外,FP4(MXFP4/NVFP4)正在成为Blackwell硬件上的新前沿,并且已经开始进入GGUF生态。短期看,这不会撼动三种主流格式的既有格局;长期看,一旦FP4生态成熟,模型格式版图可能会再次改写。对开发者而言,眼下最实际的做法仍然是按硬件和场景选格式:跨平台部署选GGUF,NVIDIA单卡追求极限性能选EXL3,vLLM多用户生产服务选AWQ,GPTQ则留给存量项目继续运转。