跳到索引

GLOSSARY

GGUF 格式

本地大模型真正加载的文件格式——一份可移植的量化权重,llama.cpp、Ollama 和 Jan 都认。

GGUF(GPT-Generated Unified Format)是让本地大模型变得可行的包装:一个文件装着分词器、元数据和量化权重,笔记本不用 Python 栈也能加载 7B 或 13B。llama.cpp 定义了它;Ollama、LM Studio 和 Jan 消费它。

名字后面的数字——Q4_K_M、Q8_0——是量化配方,在体积与质量之间权衡。GGUF 不是训练格式,也不是 Hugging Face 默认的 safetensors;它是在你自己的机器上做推理的最后一公里格式。如果你离线跑模型,几乎一定在加载 GGUF。

相关术语

使用该技术的工具

相关分类