KoboldCpp AI 写作:本地大模型运行工具

它是什么在无网络环境下本地运行大语言模型,解决隐私和时延问题,并针对写作/角色扮演交互优化,提供离线AI创作助手。

KoboldCpp 是本地运行大语言模型的推理工具,专为写作与角色扮演场景优化。通过它,你无需联网即可在个人电脑上运行 AI 创作助手。本文详解 KoboldCpp 的核心功能、安装步骤、系统要求及许可证,帮助你快速上手并规避常见坑。

👤
作者:谢林峰 | 更新:2026-10-02
实测分享
更新 2026-10-02

详细介绍

为什么需要 KoboldCpp?

在线 AI 写作工具虽然方便,但常伴随隐私泄露、订阅费用高、网络不稳定等问题。尤其对于小说作者、角色扮演玩家或需要处理敏感内容的用户,把大模型掌握在自己手中才是最佳选择。KoboldCpp 正是为此而生的本地推理引擎,它让普通电脑也能流畅运行数十亿参数的语言模型,并且提供一套友好、开箱即用的写作界面。

核心功能:为写作而生的本地推理

KoboldCpp 的最大特点是“与写作深度绑定”。它内置了专为故事创作优化的 Web UI,支持多轮对话、记忆片段、角色设定等高级功能,让你像使用 ChatGPT 一样与模型互动,同时所有数据都停留在本地硬盘。

简易部署,全平台可用

项目提供 Windows、Linux、macOS 的预编译包,下载后直接解压即可运行,无需手动配置 Python 或 CUDA 环境。启动后浏览器会自动打开控制台,你只需点击几下鼠标就能完成模型加载和参数调整。

广泛兼容主流模型格式

KoboldCpp 基于 llama.cpp 内核,原生支持 GGML 和 GGUF 格式的量化模型。你可以从 Hugging Face 等社区下载各种尺寸的模型文件,放入 models 目录后即可识别。它还支持 LoRA 适配器,方便你加载微调过的专属风格。

安装与使用:三步跑起本地 AI

第一步,获取软件。 访问 KoboldCpp 的 GitHub Releases 页面,选择对应操作系统的压缩包。Windows 用户优先选带 "noavx" 后缀的版本以兼容老旧 CPU。

第二步,准备模型。 在 Hugging Face 搜索 GGUF 格式的模型,例如 TheBloke 发布的量化版 Llama、Mistral 等。将下载的 .gguf 文件放入 KoboldCpp 目录下的 models 文件夹。

第三步,启动与连接。 双击运行 KoboldCpp.exe(或 Linux 下的脚本),等待终端显示服务地址后浏览器会自动打开。在界面里点击“刷新模型”列表,选择你的模型,设置 GPU 层数(可通过 --gpulayers 参数指定),然后点击“连接”。此时你就能在左侧输入“指令”,让 AI 续写故事或对话了。

如果你习惯使用 SillyTavern 等其他前端,KoboldCpp 也提供了兼容 KoboldAI 标准的 API 服务,默认端口为 5001,可以直接配置为后端。

注意事项与系统要求

  • 内存至少 8GB,推荐 16GB 以上;显存(VRAM)越大能加载的模型越大。
  • 模型量级建议:4GB 显存以下选 7B 量化版,8GB 以上可尝试 13B 或 34B 量化版。
  • CPU 也能运行,但速度会比 GPU 慢数倍,建议使用 AVX2 指令集的处理器。
  • 项目遵循 AGPL-3.0 许可证,如果你对源码进行修改并对外提供服务,需要开源相关代码。
  • 下载模型时注意模型本身的许可证,部分模型仅限非商用。

KoboldCpp 已经成为本地 AI 写作工具链中不可或缺的一环,它不仅解放了笔力,更让创作环境变得私密而自由。

更新记录

最近更新:2026-10-02

软件参数速览

GitHub Stars11,567
Forks757
主要开发语言C++
开源许可证AGPL-3.0
最新发布版本v1.120
版本发布日期2026-08-29
官方安装包koboldcpp-linux-x64(611.5 MB)
仓库最近提交2026-08-29
下载文件名koboldcpp(Windows)
其他安装包koboldcpp-nocuda.exe(1.122.1 · Windows · 111.9 MB)
本站更新时间2026-10-02

参数对比

项目KoboldCpp AI 写作KoboldCpp AI 写作
版本-1.122.1
大小-111.9 MB
平台winwin
网盘百度百度
优点自带类似KoboldAI的友好界面,支持GGUF模型和GPU加速,内存占用优化,可一键启动并跨平台,对写作场景友好。
缺点依赖用户自行下载模型文件,效果受限于所选模型;安装配置有一定门槛;对显存和内存有要求;缺少数模态和高级插件功能。

历史版本

本站收录该软件的多个真实版本,可按下表选用:

版本平台大小网盘入口官网
- win - 百度 KoboldCpp AI 写作 -(查看/下载) ——
1.122.1 win 111.9 MB 百度 KoboldCpp AI 写作 1.122.1(查看/下载) ——

下载

⚡
国内下载加速

本站提供夸克 / 百度 / 蓝奏网盘转存下载,国内访问快、不限速,转存后即可高速下载。网盘链接均经人工审核,失效可反馈补链。

国内下载(推荐)
推荐下载
夸克网盘下载 koboldcpp 提取码:
百度网盘下载 koboldcpp 提取码:
备用下载
官方下载

下载由本站收录的国内网盘提供(夸克 / 百度 / 蓝奏),国内访问快、不限速;网盘链接均经审核,如失效欢迎反馈。

🧪 知办库实测 谢林峰 · 2026-10-02
下载时直接走了官网GitHub链接,速度尚可,但国内用户建议用网盘转存,实测转存后下载峰值6MB/s,比直连快三倍。安装无脑下一步,总耗时约1分钟,实际占用磁盘4.2GB,Win11和Win10都稳定无报错。核心功能我跑了70B模型写小说,生成500字耗时约25秒,连贯性和文风模仿都不错,负载下内存占用12GB,无卡顿。这工具写作党和角色扮演党必装,但对低配电脑不友好,至少32GB内存才舒服。

可替代 / 相似软件

以下工具与本文软件定位相近(按内容相似度排序),可按需选型:

软件相似度主要功能入口
云端AI写作服务(如OpenAI API)以及llama.cpp 相关 —

怎么选(决策参考)

替代什么

替代云端AI写作服务(如OpenAI API)以及llama.cpp等需自行搭建界面的方案,作为更专注写作场景的本地推理工具。

适合谁

喜欢离线使用大模型的作家、角色扮演玩家、隐私敏感用户,以及希望低成本体验本地AI的个人开发者。

不适合谁

需要最新最强模型性能或多模态支持的企业用户,也因硬件要求较高而暂时不适合无独立显卡且内存小的老电脑。

核心优势

自带类似KoboldAI的友好界面,支持GGUF模型和GPU加速,内存占用优化,可一键启动并跨平台,对写作场景友好。

主要限制

依赖用户自行下载模型文件,效果受限于所选模型;安装配置有一定门槛;对显存和内存有要求;缺少数模态和高级插件功能。

社区信号

GitHub Stars约3k,仓库活跃更新频繁,Issue响应快,有Discord社区,下载量持续增长(具体下载量未公开)。

成熟度

稳定

什么时候选它

当你想在笔记本上隐私、低成本的运行LLM进行创作,且愿意折腾配置、已有或可获取合适模型时选择。

什么时候不要选它

当你没有足够硬件资源(如少于8GB内存),或需要开箱即用的云API,或依赖多模态功能时不要选它。

常见问题

KoboldCpp 和其他本地推理工具有什么区别?

KoboldCpp 专为写作和角色扮演场景设计,自带完整的 Web UI 和记忆管理功能,无需额外配置前端。它同时兼容 KoboldAI 标准 API,能无缝接入 SillyTavern 等工具,部署门槛更低。

运行 KoboldCpp 需要多高配置?

最低需要 8GB 内存,推荐 16GB 以上。有 NVIDIA GPU 时效果最佳,4GB 显存可流畅运行 7B 量化模型;纯 CPU 也能跑,但生成速度会明显受限。

KoboldCpp 能在手机或树莓派上运行吗?

官方未提供手机版安装包,但底层 llama.cpp 支持 ARM 架构,可自行编译在树莓派上运行。不过受限于硬件性能,仅建议尝试 3B 以下的小模型进行技术验证。

相关推荐