text-generation-webui:本地大模型 Web 界面
text-generation-webui 是一款开源的本地大模型 Web 界面,让你无需编程就能在浏览器中运行、对话和调试大语言模型。本文将介绍它的核心功能、安装步骤、系统要求及许可证,帮助你快速搭建属于自己的私有 AI 助手。
详细介绍
为什么你需要 text-generation-webui?
想体验最新的开源大模型,却不想折腾命令行?担心数据隐私,希望所有推理都在本机完成?text-generation-webui 正是为解决这些痛点而生的工具。它将复杂的模型加载、参数调整、对话历史管理封装成简洁的网页界面,你只需点击鼠标,就能与 Llama、Mistral、Qwen 等主流模型流畅对话。无论是测试模型效果,还是搭建私人知识库,它都能让你省去大量重复造轮子的时间。
核心功能:不止是一个聊天窗口
多模型支持与灵活加载
text-generation-webui 支持多种模型格式,包括 GGUF、GPTQ、AWQ 等,并能自动识别模型所在目录。你可以在界面中一键切换模型,不必每次修改启动参数。更贴心的是,它内置了模型下载功能,可直接从 Hugging Face 拉取你指定的仓库。
丰富的交互与定制选项
界面提供流式输出、多轮对话、参数调整(温度、Top-P 等),并有聊天模式、指令模式、补全模式可选。对于进阶用户,它还集成了 LoRA 微调、加载插件(如 SillyTavern 风格角色卡)以及通过扩展实现语音输入、长文本记忆等能力。
API 与外部集成
项目自带 OpenAI 兼容的 API 服务器,你可以在界面中启动 Gradio 或 API 模式,然后通过标准 HTTP 请求调用本地模型。这意味着你现有的 ChatGPT 客户端、自动化脚本都可以无缝替换为本地推理。
安装与使用:三步搞定
首先,确保你的机器满足基本要求:Windows/Linux/macOS 系统,Python 3.9 以上,至少 8GB 显存(集成显卡或 CPU 运行会慢,但也可以尝试小模型)。接着,按以下步骤操作:
- 克隆仓库并安装依赖:
git clone https://github.com/oobabooga/text-generation-webui && cd text-generation-webui,然后执行pip install -r requirements.txt(建议在 conda 虚拟环境中安装)。 - 下载模型:在
models目录下放置 GGUF 或 GPTQ 模型文件,或用界面内置的 Model Downloader 从 Hugging Face 获取。 - 启动页面:运行
python server.py,根据提示选择界面端口(默认 7860),然后在浏览器打开http://localhost:7860即可开始对话。
注意事项与许可证
硬件方面,模型越大占用显存越高,7B 模型大约需要 6-8GB 显存,13B 模型则建议 12GB 以上。若显存不足,可开启 CPU+GPU 混合推理或者使用量化模型。另外,启动前请确保端口未被占用,并注意模型文件的存储空间。text-generation-webui 本身采用 AGPL-3.0 许可证,允许自由使用和修改,但若你分发修改版本,需开源相应改动。使用模型时,请遵守各模型自己的许可条款,例如 llama2 社区许可。
更新记录
最近更新:2026-08-18
下载
下载按优先级提供:国内网盘(第一优先,便于国内快速获取)→ 官方来源(官方正版背书)→ 源码地址(开源项目);网盘链接均经审核,如失效欢迎反馈。
怎么选(决策参考)
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
社区数据不足
暂无公开信号
暂无公开信号
暂无公开信号
常见问题
text-generation-webui 支持哪些模型格式?
它主要支持 GGUF、GPTQ、AWQ 等常见量化格式,也原生支持未量化的 HF 格式模型。你只需将模型文件放入 models 目录,界面会自动识别并加载。
我的显存只有 6GB,能运行 text-generation-webui 吗?
可以尝试运行 7B 以下的量化模型(如 Q4 或 Q5 的 GGUF),并启用 CPU 卸载部分层。若内存足够,也能以纯 CPU 模式运行小模型,但速度会明显下降。
如何通过 API 调用本地模型?
在启动 server.py 时添加 --api 参数,界面会提供 OpenAI 兼容的 /v1/chat/completions 端点。你也可以在界面的 Session 标签页中管理 API 密钥和启用状态。