本地大模型部署配置
若你希望 Agent 完全在本地推理、不依赖云端 API,可在本机部署兼容 OpenAI API 的推理服务(如 Ollama、LM Studio、vLLM 等),再在 Mystilink 中接入。
适用场景
- 隱私敏感、希望数据不出本机
- 已有 GPU/CPU 资源,想复用开源模型
- 开发调试、离线环境
本地模型的理解与生文能力取决于所选权重,通常弱于云端旗舰模型;复杂玄學解讀任务建议搭配更强模型或开启 自动回退。
总体思路
本机推理服务(Ollama / LM Studio / …)
↓ 暴露 OpenAI 兼容 HTTP API
Mystilink Agent(openai-compatible Provider)
↓
对话、任务规划、撰写解讀
Mystilink 不内置模型权重,只作为 客户端 调用你本地服务的 HTTP 接口。
方式一:Ollama(推荐入门)
Ollama 在 macOS / Windows / Linux 上安裝简单,預設提供 OpenAI 兼容端点。
1. 安裝并拉取模型
# 安裝 Ollama 后,拉取模型(示例)
ollama pull qwen2.5:7b
ollama pull llama3.2
2. 確認服务地址
Ollama 預設監聽:
| 项目 | 值 |
|---|---|
| Base URL | http://127.0.0.1:11434/v1 |
| 模型 ID | 与 ollama list 中名称一致,如 qwen2.5:7b |
| API Key | 可填任意佔位值,如 ollama(Ollama 預設不校驗) |
3. 在 Mystilink 中配置
推荐:自定义 Provider
- 設定 → 大模型 → 新建 Provider
- 模板选 自定义 Provider
- 填寫:
| 字段 | 值 |
|---|---|
| Provider ID | ollama |
| 顯示名称 | Ollama 本地 |
| API Family | openai-compatible |
| 預設 Base URL | http://127.0.0.1:11434/v1 |
| API Key | ollama(佔位) |
| 启用模型发现 | 可选(Ollama 支持 /models) |
- 创建 Provider → 添加模型 → Provider 选 Ollama → 測試連接 → 模型 ID 填
qwen2.5:7b(或你已 pull 的模型)→ 保存。
备选:OpenAI 模板 + 覆写 URL
選擇 OpenAI 模板,开启覆写 Base URL 为 http://127.0.0.1:11434/v1,API Key 填佔位值,模型 ID 填 Ollama 模型名。
方式二:LM Studio
LM Studio 提供圖形界面加载 GGUF 等格式模型,并可开启本地 OpenAI 兼容服务器。
1. 啟動本地服务器
- 在 LM Studio 中下载并加载模型。
- 切换到 Local Server / 開發者 標籤。
- 啟動服务器,记下端口(預設常为 1234)。
2. Mystilink 配置
| 项目 | 值 |
|---|---|
| Base URL | http://127.0.0.1:1234/v1 |
| 模型 ID | LM Studio 界面顯示 的模型标识 |
| API Key | 通常可留空或填 lm-studio |
按 自定义 Provider 流程创建,apiFamily 选 openai-compatible。
方式三:vLLM / llama.cpp server / text-generation-webui
以下工具同样可暴露 OpenAI 兼容 API,配置方式类似:
| 工具 | 典型 Base URL | 说明 |
|---|---|---|
| vLLM | http://127.0.0.1:8000/v1 | 啟動时加 --api-key 则需在 Mystilink 填相同 Key |
| llama.cpp server | http://127.0.0.1:8080/v1 | 以实际啟動参数为准 |
| text-generation-webui | http://127.0.0.1:5000/v1 | 需在設定中启用 OpenAI 兼容 API 擴展 |
步骤:
- 按各项目文檔啟動服务并確認
curl可訪問/v1/models或/v1/chat/completions。 - 在 Mystilink 创建 自定义 Provider,Base URL 指向该服务。
- 模型 ID 使用服务文檔中的名称(常与 Hugging Face 模型名或本地别名一致)。
- 測試連接 后再保存。
局域网 / 远程機器上的模型
若推理服务运行在另一台裝置(如带 GPU 的 Linux 服务器):
- 确保 Mystilink 所在機器能訪問该 IP 与端口(防火牆放行)。
- Base URL 使用內網地址,例如
http://192.168.1.100:11434/v1。 - 勿将无鉴权的本地服务暴露到公网。
性能与能力提示
| 主题 | 说明 |
|---|---|
| 上下文长度 | 受模型与推理框架限制;长命盘/多轮对话可能需选 32k+ 上下文模型 |
| Tool calling | Agent 依赖工具调用时,请选用支持 function calling 的本地模型与后端 |
| 速度 | CPU 推理较慢;复杂任务建议使用 GPU 或较小模型作草稿、云端模型作回退 |
| 記憶體 | 7B 量化模型约需 4–8 GB 記憶體;70B 需更大显存 |
建议开启 不可用时自动回退,并保留一条云端 官方模型 作为备选。
故障排查
| 现象 | 处理 |
|---|---|
| 連接被拒绝 | 確認 Ollama/LM Studio 已啟動;端口与 Base URL 一致 |
| 404 model not found | 模型 ID 与本地已加载名称完全一致(含 tag,如 :7b) |
| 測試极慢或超时 | 首次加载权重较慢;增大超时或换更小模型 |
| Agent 无工具能力 | 换支持 tool calling 的模型,或改用云端模型 |
更多通用網路与 Key 问题见 大模型連接问题。