Skypool Token
Token online
Sign up
DocsLM Studio

LM Studio 本地模型准备

Provider Agent 接入 LM Studio 前,下载模型、设置上下文窗口、启动本地服务并了解 Chat Completions 临时计费规则。

Updated:

什么时候需要看这页

如果你希望用 LM Studio 桌面版准备本地模型,先按这页在图形界面里下载并加载目标模型、设置上下文长度,然后启动本地 API 服务。

本页统一使用 Qwen3.8 27B 作为操作示例。qwen3.8:27b 是平台模型代码;控制台的“模型名称”用于搜索和下载本地模型,“模型 ID”用于本地 API 请求和 Provider Agent 的 --runtime-model-id。

Chat Completions 临时计费规则

LM Studio 的 /v1/chat/completions 协议因缓存统计不完善,非缓存输入暂时按照缓存输入价格计费。

这是针对上述协议的临时计费规则,不代表输入实际命中了缓存,也不适用于 /v1/responses 或 /v1/messages。具体缓存输入价格以平台模型价格为准。

适用系统和特点

LM Studio 适合希望通过图形界面搜索、下载和加载模型的本地 Provider。官方支持 Windows、macOS Apple Silicon 和 Linux;具体系统版本、CPU 和内存要求请查看 LM Studio 系统要求。

大模型和长上下文窗口会增加内存、显存占用。请按机器资源选择模型与量化版本,并以实际加载结果和 Provider Agent 预检为准。

安装 LM Studio

打开 LM Studio 下载页,按系统下载安装包。

安装后打开 LM Studio。模型搜索和下载从 Discover 页面进入,本地模型管理在 My Models 页面,本地 API 服务在 Developer 页面。界面名称可能随版本变化,下面的截图用于帮助定位入口。

LM Studio 左侧导航中的模型和 Developer 配置入口

下载模型

先打开 Provider API 密钥页,在 Token 供应示例中选择目标模型和 LM Studio 推理框架,再分别点击“复制模型名称”和“复制模型 ID”。

进入 LM Studio 的 Discover 页面,可以输入模型关键词、完整 user/model 名称,或粘贴 Hugging Face 模型地址。下载前确认完整模型来源和量化版本;操作说明见 LM Studio 下载模型。

当前平台示例对应关系如下,最终以控制台展示和本地 /v1/models 实际返回为准:

平台模型代码模型名称LM Studio 模型 ID
qwen3.8:27blmstudio-community/Qwen3.8-27B-GGUFqwen/qwen3.8-27b

下图展示搜索和下载入口;其中的模型仅为界面示例,实际操作请使用当前控制台提供的模型名称。

LM Studio 搜索并下载模型的操作入口

下载完成后,进入 My Models 页面确认目标模型已出现在本机列表中。

设置上下文窗口

在 My Models 页面点击目标模型旁边的齿轮按钮,设置默认加载参数,将 Context Length 或 Context Size 调整为目标上下文长度。也可以在加载前的 Load Settings 中调整;保存默认值后,下次加载模型会使用这些设置。详见 LM Studio 模型默认加载设置。

如果你的版本提供 Settings → Model Defaults → Default Context Length,也可以设置后续模型加载的默认上下文长度,再检查单个模型的实际加载配置。

LM Studio Model Defaults 中设置默认上下文窗口大小

本页的 qwen3.8:27b 示例推荐设置为 262144(256K);如果机器资源不足,最低应保持 131072(128K),低于平台要求将无法通过 Provider Agent 启动预检。其他模型请按控制台展示的模型要求和本地模型能力设置。

在 Developer 页面加载模型时,也可以在模型的 Context and Offload 区域检查 Context Length。修改后如果提示需要重新加载,点击 Reload to apply changes,使新设置实际生效。

LM Studio Developer 页面设置模型上下文窗口

Context Length 是加载模型时的上下文窗口;请求体里的 max_tokens 只限制本次最多生成多少 token,不能代替上下文窗口设置。

加载模型

在 Chat 或 Developer 页面选择已下载的目标模型,确认上下文设置后手动加载。本教程按预先加载模型的流程接入,不依赖请求到达后自动加载模型。

加载完成后,先在 Chat 页面输入一个简单问题,确认能够正常返回文本。随后在 Developer 页面检查目标模型处于 READY 状态。

启动本地 API 服务

进入 Developer 页面,打开 Start server 开关。官方操作说明见 LM Studio 本地 API Server。

在 Server Settings 中检查以下配置:

  • Server Port:本页使用 1234,如果修改过端口,后续命令也要同步修改。
  • Serve on Local Network:仅在需要局域网访问时开启。
  • Require Authentication:如已开启,为 Provider Agent 准备对应 API Token。
  • Just in Time Model Loading:本教程建议关闭,并在接入前手动加载目标模型。

各开关说明见 LM Studio Server Settings。

本页使用的 OpenAI-compatible base URL 是:

Text
http://127.0.0.1:1234/v1

默认本地服务不要求 API Key;如果开启 Require Authentication,请在后续 HTTP 请求中添加 Authorization: Bearer <LMSTUDIO_TOKEN>,并在 Provider Agent 预检和启动时传入 --runtime-api-key <LMSTUDIO_TOKEN>。API Token 的创建和权限设置见 LM Studio Authentication。

服务启动后,Developer 页面应显示 Running,并给出可访问地址。确认目标模型处于 READY 状态,再继续验证接口。

LM Studio 本地服务已运行且模型 READY

验证 LM Studio 服务

下面的多行命令使用 Bash 写法;Windows 用户可在 Git Bash 或 WSL 中执行。

查看模型列表:

Bash
curl http://127.0.0.1:1234/v1/models

/v1/models 可能在启用即时加载时列出尚未加载的模型,因此模型出现在列表中不等于已经加载。请同时检查 Developer 页面的加载状态,详见 LM Studio 模型列表接口。

做一次非流式推理,model 使用 /v1/models 里看到的实际 ID:

Bash
curl http://127.0.0.1:1234/v1/chat/completions \  -H "Content-Type: application/json" \  --data-raw '{    "model": "qwen/qwen3.8-27b",    "messages": [      {        "role": "user",        "content": "用一句中文回复:LM Studio 服务可用。"      }    ],    "max_tokens": 64,    "temperature": 0.2  }'

接口和参数说明见 LM Studio Chat Completions。若启用了鉴权,上面的模型列表和推理请求都需要同时添加对应 Authorization 请求头。

启动 Provider Agent

确认本地模型已加载、服务验证通过后,先跑预检:

Bash
./token-provider-agent preflight start \  --model qwen3.8:27b \  --base-url http://127.0.0.1:1234 \  --api-format lmstudio \  --runtime-model-id qwen/qwen3.8-27b

预检通过后正式启动:

Bash
./token-provider-agent start \  --api-key stp-... \  --model qwen3.8:27b \  --base-url http://127.0.0.1:1234 \  --api-format lmstudio \  --runtime-model-id qwen/qwen3.8-27b

如果 LM Studio 开启了鉴权,上面两条命令都增加:

Text
--runtime-api-key <LMSTUDIO_TOKEN>

--api-key 使用天池平台创建的 Provider API Key,--runtime-api-key 使用 LM Studio 的 API Token。节点在线确认和诊断方式见 供应 Token 指南。