网站简介
项目全称:LostRuins/koboldcpp 一、项目简介 核心底层:基于llama.cpp开发,开源免费(MIT 协议),由开发者 LostRuins 维护;专门运行 GGUF(旧版 GGML)格式大模型,主打单文件可执行程序、免安装、本地离线运行。 定位:集成 KoboldAI‑Lite 网页 UI + LLM 后端服务;兼顾普通人可视化使用与开发者 API 调用;非常适合本地 AI 写作(小说、长篇文章)、角色对话、私有化部署大模型;同时附带图像生成、语音能力。 支持平台:Windows、Linux、macOS、Android (Termux);NVIDIA‑CUDA、AMD‑Vulkan、Apple Metal、纯 CPU 运行均可,低配电脑也可以跑 7B 模型。 和同类工具区分: Ollama:后台服务为主,自带模型下载,但内置 UI 简陋; LM‑Studio:侧重模型管理; KoboldCpp:原生自带写作向 Web 界面 + OpenAI 兼容 API + 多模态,做小说、长篇续写体验是三者里最优。 二、核心功能 1. 文本生成(最核心,AI 写作重点) 兼容全部主流 GGUF 模型:Llama‑3、Qwen‑2.5、Mistral、DeepSeek‑R1、中文网文模型;专门针对长文本创作做大量优化。 KoboldAI‑Lite 内置 Web 写作页面(浏览器打开127.0.0.1:5001): World Info:世界设定库,写小说时自动把人物背景、世界观注入上下文; Author’s Note:作者指令,隐形给模型下达创作要求; 故事存档、分段编辑、续写、回溯历史版本; 内置多种模式:StoryWriter 小说模式、对话模式、指令模式、冒险模式; 支持导入 TavernAI 角色卡片,写网文、小说、公众号长篇文章非常友好。 长上下文增强:依靠Context‑Shift上下文滑动技术,突破原生窗口限制,可以写几万字长篇内容,解决普通模型长文本遗忘问题;支持 RoPE 缩放扩展上下文长度。 高级采样器:DRY、XTC 采样器,降低 AI 重复语句,减少文章机器味,写出来内容更自然。 支持 LoRA 适配器加载,给模型注入专属文风。 2. 多模态附加能力(可选开启) 图片生成:内置 SD1.5、SDXL、FLUX,在对话里直接生成配图; Whisper‑cpp:语音转文字;Oute‑TTS:文本转语音; 内置简易 RAG:TextDB 检索,可以导入参考文档写调研报告; 接入 AI‑Horde 分布式算力网络,可把本机作为算力节点或者调用公共算力。 3. API 服务(开发者最重要功能) 对外暴露兼容 OpenAI、Ollama、KoboldAI、A1111 的 API 接口,可被自己的程序调用: plaintext http://127.0.0.1:5001/v1 你可以用 Python、FastAPI 调用这个接口做自己的 AI 写作网站;也可以对接 SillyTavern 等第三方前端。 4. 性能优化特性 分层 GPU 卸载(gpu‑layers):把部分模型层放到显卡显存,剩余放内存;4GB 显存电脑也可以运行 7B 模型; 推测解码(Speculative Decoding):用小模型做草稿加速大模型推理; 支持 MMAP 内存映射、FlashAttention,大幅提升推理速度。 三、使用方法 方式 1:普通用户(Windows 一键使用,最简单) 打开 GitHub Releases 页面,下载对应系统打包好的koboldcpp.exe,无需安装、不用装 Python 环境。 双击 exe,弹出启动配置窗口: 选择 CUDA/Vulkan;设置 GPU‑Layers 显存占用层数; 选择下载好的 GGUF 模型文件(推荐 Q4_K_M 量化版本); 点击 Launch,浏览器自动打开 http://localhost:5001; 在网页端写小说、续写文章、对话创作即可;全部运行在本地电脑,不会上传内容到云端。 方式 2:命令行启动(Linux/macOS 服务器部署) bash 运行 # 赋予执行权限 chmod +x koboldcpp-linux-x64-cuda1210 # 指定模型和上下文窗口启动 ./koboldcpp-linux-x64-cuda1210 --model qwen2.5-7b-q4_k_m.gguf --contextsize 8192 --gpulayers 30 启动之后 API 服务和网页界面同时开启;服务器部署之后内网其他电脑也可以访问写作页面。 方式 3:源码编译部署(高级开发者) bash 运行 git clone https://github.com/LostRuins/koboldcpp cd koboldcpp make LLAMA_CUBLAS=1 #开启CUDA加速 编译后自定义删减功能、二次开发。 优缺点总结 优点 开箱即用,单文件程序,配置门槛低于 oobabooga‑text‑generation‑webui; 专门针对长篇写作优化,内置小说创作专属功能; 完全离线,隐私安全;模型格式统一 GGUF 生态成熟; API 兼容 OpenAI,二次开发简单; 跨平台,老旧电脑也能运行。 缺点 只能加载 GGUF 格式模型,不能直接加载原生 Hugging‑Face 原版模型,需要提前转 GGUF; 高级参数较多,想要极致出文效果需要调整采样器; 网页 UI 仅基础写作功能,不具备导出 Word、PDF 能力(需要自己调用 API 后续处理)。 选型建议 只想本地电脑离线写小说、长篇文章:选 KoboldCpp; 开发 SaaS 写作网站:调用它的 API 搭配前端页面; 云端生成万字行业报告:选用 STORM、WriteHERE 项目。