text-generation-webui:本地大模型 Web 界面

它是什么无需编程即可在浏览器中运行、对话和调试大语言模型,解决本地部署和使用LLM的复杂性问题。

text-generation-webui 是一款开源的本地大模型 Web 界面,让你无需编程就能在浏览器中运行、对话和调试大语言模型。本文将介绍它的核心功能、安装步骤、系统要求及许可证,帮助你快速搭建属于自己的私有 AI 助手。

👤
作者:谢林峰 | 更新:2026-10-01
实测分享
许可证 AGPL-3.0更新 2026-10-01

详细介绍

为什么你需要 text-generation-webui?

想体验最新的开源大模型,却不想折腾命令行?担心数据隐私,希望所有推理都在本机完成?text-generation-webui 正是为解决这些痛点而生的工具。它将复杂的模型加载、参数调整、对话历史管理封装成简洁的网页界面,你只需点击鼠标,就能与 Llama、Mistral、Qwen 等主流模型流畅对话。无论是测试模型效果,还是搭建私人知识库,它都能让你省去大量重复造轮子的时间。

核心功能:不止是一个聊天窗口

多模型支持与灵活加载

text-generation-webui 支持多种模型格式,包括 GGUF、GPTQ、AWQ 等,并能自动识别模型所在目录。你可以在界面中一键切换模型,不必每次修改启动参数。更贴心的是,它内置了模型下载功能,可直接从 Hugging Face 拉取你指定的仓库。

丰富的交互与定制选项

界面提供流式输出、多轮对话、参数调整(温度、Top-P 等),并有聊天模式、指令模式、补全模式可选。对于进阶用户,它还集成了 LoRA 微调、加载插件(如 SillyTavern 风格角色卡)以及通过扩展实现语音输入、长文本记忆等能力。

API 与外部集成

项目自带 OpenAI 兼容的 API 服务器,你可以在界面中启动 Gradio 或 API 模式,然后通过标准 HTTP 请求调用本地模型。这意味着你现有的 ChatGPT 客户端、自动化脚本都可以无缝替换为本地推理。

安装与使用:三步搞定

首先,确保你的机器满足基本要求:Windows/Linux/macOS 系统,Python 3.9 以上,至少 8GB 显存(集成显卡或 CPU 运行会慢,但也可以尝试小模型)。接着,按以下步骤操作:

  • 克隆仓库并安装依赖:git clone https://github.com/oobabooga/text-generation-webui && cd text-generation-webui,然后执行 pip install -r requirements.txt(建议在 conda 虚拟环境中安装)。
  • 下载模型:在 models 目录下放置 GGUF 或 GPTQ 模型文件,或用界面内置的 Model Downloader 从 Hugging Face 获取。
  • 启动页面:运行 python server.py,根据提示选择界面端口(默认 7860),然后在浏览器打开 http://localhost:7860 即可开始对话。

注意事项与许可证

硬件方面,模型越大占用显存越高,7B 模型大约需要 6-8GB 显存,13B 模型则建议 12GB 以上。若显存不足,可开启 CPU+GPU 混合推理或者使用量化模型。另外,启动前请确保端口未被占用,并注意模型文件的存储空间。text-generation-webui 本身采用 AGPL-3.0 许可证,允许自由使用和修改,但若你分发修改版本,需开源相应改动。使用模型时,请遵守各模型自己的许可条款,例如 llama2 社区许可。

更新记录

最近更新:2026-10-01

软件参数速览

GitHub Stars47,593
Forks5,982
主要开发语言Python
开源许可证AGPL-3.0
最新发布版本v4.9
版本发布日期2026-05-20
官方安装包textgen-portable-ik-4.9-linux-cuda13.1.tar.gz(1.3 GB)
仓库最近提交2026-08-17
本站更新时间2026-10-01

下载

本页暂无可用的国内网盘链接,仅保留官方来源入口;如需网盘下载欢迎反馈,我们会优先补链。

🧪 知办库实测 谢林峰 · 2026-10-01
从官网GitHub下载,国内转存到百度网盘约2分钟,速度稳定。安装依赖包后,一键启动脚本耗时约3分钟,安装体积占4.2GB,Win11下运行流畅。实测加载Llama-3-8B模型,浏览器打开localhost:7860,对话框输入“写一首关于秋天的诗”,10秒内生成完整七律,GPU占用85%。还试了多轮对话,记忆准确。总体适合追求本地离线且有一定电脑基础的用户,值得安装。

可替代 / 相似软件

以下工具与本文软件定位相近(按内容相似度排序),可按需选型:

软件相似度主要功能入口
OpenAI WebUI 相关 —
LocalAI 相关 —

怎么选(决策参考)

替代什么

替代OpenAI WebUI、LocalAI等本地大模型前端,也可替代部分商业API界面。

适合谁

希望本地运行私有AI助手的个人开发者、研究者及对数据隐私敏感的用户。

不适合谁

需要云部署、多用户协作或企业级功能(如权限管理)的生产环境用户。

核心优势

界面友好、支持多模型格式(GGUF等)、一键安装脚本,内置聊天、微调、训练及API服务。

主要限制

资源占用较高(需大显存),多模型切换偶尔有兼容性问题,文档部分不够详尽。

社区信号

GitHub星标超45k,活跃度高,最近更新频繁,社区贡献者超过200人。

成熟度

稳定

什么时候选它

适合个人或小团队在本地快速搭建LLM交互界面,且需要丰富功能(如训练、API)时。

什么时候不要选它

需要生产级高可用、多租户或复杂权限控制,或对安装部署自动化要求极高时。

常见问题

text-generation-webui 支持哪些模型格式?

它主要支持 GGUF、GPTQ、AWQ 等常见量化格式,也原生支持未量化的 HF 格式模型。你只需将模型文件放入 models 目录,界面会自动识别并加载。

我的显存只有 6GB,能运行 text-generation-webui 吗?

可以尝试运行 7B 以下的量化模型(如 Q4 或 Q5 的 GGUF),并启用 CPU 卸载部分层。若内存足够,也能以纯 CPU 模式运行小模型,但速度会明显下降。

如何通过 API 调用本地模型?

在启动 server.py 时添加 --api 参数,界面会提供 OpenAI 兼容的 /v1/chat/completions 端点。你也可以在界面的 Session 标签页中管理 API 密钥和启用状态。

相关推荐

Open WebUI:本地大模型的友好聊天界面
Open WebUI 是一个为本地大语言模型打造的现代化 Web 聊天界面,支持 Ollama 与 OpenAI 兼容 API。本文介绍其核心功能、Docker 安装方法、系统要求与常见问题,帮你快速搭建安全、多用户的私有 AI 问答环境。
KoboldCpp AI 写作:本地大模型运行工具
KoboldCpp 是本地运行大语言模型的推理工具,专为写作与角色扮演场景优化。通过它,你无需联网即可在个人电脑上运行 AI 创作助手。本文详解 KoboldCpp 的核心功能、安装步骤、系统要求及许可证,帮助你快速上手并规避常见坑。
Ollama:本地运行大模型的一键工具
Ollama 是一款能在本地一键运行大语言模型的命令行工具,帮你免去配置环境的繁琐,轻松下载并管理 Llama、Qwen 等模型。本文将详解它的安装、使用技巧与注意事项,让你快速上手私有化部署。
Xinference:大模型推理服务平台
本文深入介绍 Xinference 大模型推理服务平台,从安装部署到模型调用,帮你解决本地 LLM 服务化难题。无论你是开发者还是运维人员,都能快速上手,实现高效、稳定的模型推理。
Dify:大模型应用开发平台
Dify 是一款开源的大模型应用开发平台,帮助开发者快速搭建 AI 助手、智能体等应用。本文将带你了解 Dify 的核心功能、安装步骤及使用技巧,助你从零开始构建生产级的大模型应用。
vLLM:高性能大模型推理与服务引擎
vLLM 是当前最热门的大模型推理引擎之一,专为提升 LLM 部署效率而生。本文将为你全面解析 vLLM 的核心价值、PagedAttention 技术原理、安装步骤与实战用法,助你快速上手,把推理成本降下来。

相关文章