功能总览
当前 Provider Agent 支持 Unsloth Desktop、LM Studio、vLLM、oMLX 和 llama.cpp。本页对比通过天池 Backend → Relay → Provider 使用这些框架时的功能,帮助你选择框架和请求协议。
“支持”包含平台兼容处理,以已测版本、模型及对应平台实现为依据。实际使用还需要本地框架提供相应接口、模型通过预检;框架接入成功不代表所有功能均已对齐。
| 推理框架 | 缓存输入统计 | cancel 计费 | timeout 计费 |
|---|---|---|---|
| Unsloth Desktop | Chat 支持;Responses、Messages 未知 | 暂不支持 | 暂不支持 |
| LM Studio | Chat 未知;Responses、Messages 支持 | 暂不支持 | 暂不支持 |
| vLLM | 三协议支持 | Chat 单候选 SSE 支持快照计费 | Chat 单候选 SSE 绝对超时支持快照计费 |
| oMLX | 三协议支持;Messages 需缓存配置适配 | 暂不支持 | 暂不支持 |
| llama.cpp | 三协议支持 | Chat、Responses 单输出 SSE 支持快照计费 | Chat、Responses 单输出 SSE 绝对超时支持快照计费 |
三协议指 OpenAI Chat Completions(/v1/chat/completions)、OpenAI Responses(/v1/responses)和 Anthropic Messages(/v1/messages)。
SSE(Server-Sent Events,服务器发送事件)是一种由服务端通过 HTTP 连接持续向客户端推送事件的机制。本页中的 SSE 指流式响应(stream=true),模型输出会分段返回,无需等待完整生成结束。
表中 timeout 仅指流式请求达到绝对执行时限(当前为 30 分钟),不包含首输出等待超时或流中空闲超时。timeout 已有合法最终用量时优先采用;否则与 cancel 一样,按终态生效前已确认的有效累计快照结算,没有有效快照时释放冻结,不估算收费。
缓存输入统计
下表适用于请求正常完成时的最终用量;流式和非流式均包含在内。缓存统计未知的组合仍可正常请求和计费。
| 推理框架 | Chat Completions | Responses | Messages |
|---|---|---|---|
| Unsloth Desktop | 支持 | 未知,缓存输入价兜底 | 未知,缓存输入价兜底 |
| LM Studio | 未知,缓存输入价兜底 | 支持 | 支持 |
| vLLM | 支持 | 支持 | 支持 |
| oMLX | 支持 | 支持 | 支持;Provider 自动补齐缓存配置 |
| llama.cpp | 支持 | 支持 | 支持 |
- 支持:按可信统计区分缓存输入和普通输入;明确返回缓存数
0表示未命中,按普通输入价计费。缓存创建也按普通输入计费。 - 未知(Unknown):框架未提供可信的缓存拆分,平台保留“未知”,全部输入按缓存输入价兜底。这不代表实际全部命中缓存,也不会把缺失统计补成未命中
0。 - oMLX Messages:没有显式缓存配置时,Provider 会在适用的文本块补齐
cache_control;已有配置保持原样。无法安全补齐或无法确认明细时,仍按未知处理。 - vLLM:已测环境启用了前缀缓存和
--enable-prompt-tokens-details。使用其他版本或启动配置时,需要确认实际返回的缓存明细,不能仅凭响应变快判断命中。
LM Studio Chat 的临时输入计费规则见 LM Studio 本地模型准备。具体单价以平台模型价格为准。