llamafile
![[在略微打开的装满文件的牛皮纸文件夹前的羊头线条画]](https://raw.githubusercontent.com/Mozilla-Ocho/llamafile/main/docs/images/llamafile-640x640.png)
llamafile 让你能够以单个文件的形式分发和运行 LLM。
llamafile 是一个 Mozilla Builders 项目(参见其公告博客文章),现由 Mozilla.ai 重新打造。
我们的目标是让开源 LLM 对开发者和最终用户都更加 易于获取。我们通过将 llama.cpp 与 Cosmopolitan Libc 结合到一个 框架中来实现这一点,该框架将 LLM 的所有复杂性简化为 一个单文件可执行程序(称为 "llamafile"),可在大多数操作系统和 CPU 架构上 本地运行,无需安装。
llamafile 还包含 whisperfile,一个基于 whisper.cpp 和相同 Cosmopolitan 打包技术的单文件语音转文本工具。它支持在所有相同平台上对音频文件进行转录和翻译,无需安装。
v0.10.*
llamafile 从 0.10.0 版本开始使用新的构建系统,旨在使我们的代码更容易 与 llama.cpp 的最新版本保持一致。这意味着它们支持更新的模型和功能, 但同时也可能缺少一些 您曾经习惯的功能(请参阅此文档以获取有关所做更改的高级描述)。如果您更喜欢 “经典体验”,您始终可以从我们的 发布页面访问之前的版本。我们预构建的 llamafile 始终 显示它们捆绑的服务器版本(0.9.* 示例、0.10.* 示例),因此您始终知道 正在下载的软件版本。
我们想听听您的意见! 无论您是新用户还是长期粉丝,请分享您认为 llamafile 最有价值的地方,以及什么会让它对您更有用。 通过博客阅读更多,并在此处加入讨论。
快速入门
几分钟内下载并运行您的第一个 llamafile:
# Download an example model (Qwen3.5 0.8B)
curl -LO https://huggingface.co/mozilla-ai/llamafile_0.10/resolve/main/Qwen3.5-0.8B-Q8_0.llamafile
# Make it executable (macOS/Linux/BSD)
chmod +x Qwen3.5-0.8B-Q8_0.llamafile
# Run it
./Qwen3.5-0.8B-Q8_0.llamafile
我们选择这个模型,因为它是我们构建 llamafile 的最小模型,因此最有可能开箱即用。 如果您拥有强大的硬件和/或 GPU,请随意选择 更大、更具表现力的模型,它们应能提供更准确的 响应。
Windows 用户: 在运行之前,请重命名文件以添加 .exe 扩展名。
注意 - 只有小于 4GB 的可执行文件才能在 Windows 上运行,因此任何大于 4GB 的 llamafile 都无法工作。请下载 llamafile 二进制文件,并使用任何 外部权重/模型(GGUF) 运行它。
文档
在 docs.mozilla.ai/llamafile 查看完整文档,或直接跳转到以下子章节之一:
许可
虽然 llamafile 项目采用 Apache 2.0 许可,但我们对 llama.cpp 和 whisper.cpp 的修改采用 MIT 许可(与项目本身一样),以便在未来保持兼容性和可上游化,如果希望如此的话。
本页面上的 llamafile 标志是在 DALL·E 3 的协助下生成的。