text-generation-webui:本地大模型 Web 界面
它是什么无需编程即可在浏览器中运行、对话和调试大语言模型,解决本地部署和使用LLM的复杂性问题。
text-generation-webui 是一款开源的本地大模型 Web 界面,让你无需编程就能在浏览器中运行、对话和调试大语言模型。本文将介绍它的核心功能、安装步骤、系统要求及许可证,帮助你快速搭建属于自己的私有 AI 助手。
详细介绍
为什么你需要 text-generation-webui?
想体验最新的开源大模型,却不想折腾命令行?担心数据隐私,希望所有推理都在本机完成?text-generation-webui 正是为解决这些痛点而生的工具。它将复杂的模型加载、参数调整、对话历史管理封装成简洁的网页界面,你只需点击鼠标,就能与 Llama、Mistral、Qwen 等主流模型流畅对话。无论是测试模型效果,还是搭建私人知识库,它都能让你省去大量重复造轮子的时间。
核心功能:不止是一个聊天窗口
多模型支持与灵活加载
text-generation-webui 支持多种模型格式,包括 GGUF、GPTQ、AWQ 等,并能自动识别模型所在目录。你可以在界面中一键切换模型,不必每次修改启动参数。更贴心的是,它内置了模型下载功能,可直接从 Hugging Face 拉取你指定的仓库。
丰富的交互与定制选项
界面提供流式输出、多轮对话、参数调整(温度、Top-P 等),并有聊天模式、指令模式、补全模式可选。对于进阶用户,它还集成了 LoRA 微调、加载插件(如 SillyTavern 风格角色卡)以及通过扩展实现语音输入、长文本记忆等能力。
API 与外部集成
项目自带 OpenAI 兼容的 API 服务器,你可以在界面中启动 Gradio 或 API 模式,然后通过标准 HTTP 请求调用本地模型。这意味着你现有的 ChatGPT 客户端、自动化脚本都可以无缝替换为本地推理。
安装与使用:三步搞定
首先,确保你的机器满足基本要求:Windows/Linux/macOS 系统,Python 3.9 以上,至少 8GB 显存(集成显卡或 CPU 运行会慢,但也可以尝试小模型)。接着,按以下步骤操作:
- 克隆仓库并安装依赖:
git clone https://github.com/oobabooga/text-generation-webui && cd text-generation-webui,然后执行pip install -r requirements.txt(建议在 conda 虚拟环境中安装)。 - 下载模型:在
models目录下放置 GGUF 或 GPTQ 模型文件,或用界面内置的 Model Downloader 从 Hugging Face 获取。 - 启动页面:运行
python server.py,根据提示选择界面端口(默认 7860),然后在浏览器打开http://localhost:7860即可开始对话。
注意事项与许可证
硬件方面,模型越大占用显存越高,7B 模型大约需要 6-8GB 显存,13B 模型则建议 12GB 以上。若显存不足,可开启 CPU+GPU 混合推理或者使用量化模型。另外,启动前请确保端口未被占用,并注意模型文件的存储空间。text-generation-webui 本身采用 AGPL-3.0 许可证,允许自由使用和修改,但若你分发修改版本,需开源相应改动。使用模型时,请遵守各模型自己的许可条款,例如 llama2 社区许可。
更新记录
最近更新:2026-10-01
软件参数速览
下载
本页暂无可用的国内网盘链接,仅保留官方来源入口;如需网盘下载欢迎反馈,我们会优先补链。
可替代 / 相似软件
以下工具与本文软件定位相近(按内容相似度排序),可按需选型:
| 软件 | 相似度 | 主要功能 | 入口 |
|---|---|---|---|
| OpenAI WebUI | 相关 | — | 查看 |
| LocalAI | 相关 | — | 官网评估 |
怎么选(决策参考)
替代OpenAI WebUI、LocalAI等本地大模型前端,也可替代部分商业API界面。
希望本地运行私有AI助手的个人开发者、研究者及对数据隐私敏感的用户。
需要云部署、多用户协作或企业级功能(如权限管理)的生产环境用户。
界面友好、支持多模型格式(GGUF等)、一键安装脚本,内置聊天、微调、训练及API服务。
资源占用较高(需大显存),多模型切换偶尔有兼容性问题,文档部分不够详尽。
GitHub星标超45k,活跃度高,最近更新频繁,社区贡献者超过200人。
稳定
适合个人或小团队在本地快速搭建LLM交互界面,且需要丰富功能(如训练、API)时。
需要生产级高可用、多租户或复杂权限控制,或对安装部署自动化要求极高时。
常见问题
text-generation-webui 支持哪些模型格式?
它主要支持 GGUF、GPTQ、AWQ 等常见量化格式,也原生支持未量化的 HF 格式模型。你只需将模型文件放入 models 目录,界面会自动识别并加载。
我的显存只有 6GB,能运行 text-generation-webui 吗?
可以尝试运行 7B 以下的量化模型(如 Q4 或 Q5 的 GGUF),并启用 CPU 卸载部分层。若内存足够,也能以纯 CPU 模式运行小模型,但速度会明显下降。
如何通过 API 调用本地模型?
在启动 server.py 时添加 --api 参数,界面会提供 OpenAI 兼容的 /v1/chat/completions 端点。你也可以在界面的 Session 标签页中管理 API 密钥和启用状态。