你的 GPU,任何工具都能用。
AI 对话模块内置 OpenAI 兼容 API — 把本机算力提供给第三方应用:终端 coding agent、编辑器插件、自动化脚本。零 API 费用、不排队,你的代码与提示词不出机。
三步接上
启动模型后,对话模块同时是一个本机推理服务 — 任何支持自定义端点的工具都能直接连上。
- 1
在 App 启动模型
打开 AI 对话,选择并启动一个已下载的模型 — 它就是 API 背后的推理引擎。
- 2
获取端点信息
侧边栏「API 配置」页会列出 Base URL 与可用的模型名称,复制即可。
- 3
填进你的工具
在第三方工具的自定义供应商设置填入 Base URL 与模型名称 — 完成,开始用自己的 GPU 推理。
示例:用 opencode 在终端写程序
opencode 是开源的终端 AI coding agent。把它指向本机端点,你的编码助手就完全跑在自己的 GPU 上 — 读代码、改代码、跑指令,全程离线。
在 opencode 的自定义供应商(custom provider)设置中,只需要三个信息:
设置格式以 opencode 官方文档的 custom provider 章节为准;端点与模型名称以 App 内「API 配置」页显示为准。任何支持自定义 OpenAI 兼容供应商的工具(编辑器插件、聊天客户端、脚本)都是同样三个信息。
工具拿到的,是完整的推理服务
OpenAI 兼容
标准 chat completions 端点(/v1),支持 SSE 流式响应 — 为 OpenAI API 写的工具几乎都能直接用。
Anthropic 兼容
另提供 Anthropic 兼容端点(/anthropic/v1),为 Claude API 设计的工具也接得上。
本机端点
服务跑在你电脑的 2918 端口;默认只绑本机(127.0.0.1),数据不出你的电脑。
流式响应
SSE 流式照常运作 — coding agent 的逐字输出体验与云端 API 无异。
上下文与参数
上下文长度与生成参数依你所选的模型而定,与 App 内对话同一套引擎。
零额度焦虑
没有 token 计费、没有速率限制方案 — 上限就是你的硬件。
使用前该知道的事
默认 API 只绑本机。要让同一网络的其他电脑使用,可在设置开启 LAN 模式 — 此接口不设连接认证,请只在信任的网络开启,并勿暴露于公开互联网。
响应速度与可用的上下文长度,由你的 GPU 与所选模型决定。
经 API 使用同样受用户许可协议与可接受使用条款(AUP)约束。
