Skypool Token
Token online
Sign up
Docs框架功能表

框架功能表

对比五种推理框架的缓存输入统计、取消计费和超时计费支持情况。

Updated:

功能总览

当前 Provider Agent 支持 Unsloth Desktop、LM Studio、vLLM、oMLX 和 llama.cpp。本页对比通过天池 Backend → Relay → Provider 使用这些框架时的功能,帮助你选择框架和请求协议。

“支持”包含平台兼容处理,以已测版本、模型及对应平台实现为依据。实际使用还需要本地框架提供相应接口、模型通过预检;框架接入成功不代表所有功能均已对齐。

推理框架缓存输入统计cancel 计费timeout 计费
Unsloth DesktopChat 支持;Responses、Messages 未知暂不支持暂不支持
LM StudioChat 未知;Responses、Messages 支持暂不支持暂不支持
vLLM三协议支持Chat 单候选 SSE 支持快照计费Chat 单候选 SSE 绝对超时支持快照计费
oMLX三协议支持;Messages 需缓存配置适配暂不支持暂不支持
llama.cpp三协议支持Chat、Responses 单输出 SSE 支持快照计费Chat、Responses 单输出 SSE 绝对超时支持快照计费

三协议指 OpenAI Chat Completions(/v1/chat/completions)、OpenAI Responses(/v1/responses)和 Anthropic Messages(/v1/messages)。

SSE(Server-Sent Events,服务器发送事件)是一种由服务端通过 HTTP 连接持续向客户端推送事件的机制。本页中的 SSE 指流式响应(stream=true),模型输出会分段返回,无需等待完整生成结束。

表中 timeout 仅指流式请求达到绝对执行时限(当前为 30 分钟),不包含首输出等待超时或流中空闲超时。timeout 已有合法最终用量时优先采用;否则与 cancel 一样,按终态生效前已确认的有效累计快照结算,没有有效快照时释放冻结,不估算收费。

缓存输入统计

下表适用于请求正常完成时的最终用量;流式和非流式均包含在内。缓存统计未知的组合仍可正常请求和计费。

推理框架Chat CompletionsResponsesMessages
Unsloth Desktop支持未知,缓存输入价兜底未知,缓存输入价兜底
LM Studio未知,缓存输入价兜底支持支持
vLLM支持支持支持
oMLX支持支持支持;Provider 自动补齐缓存配置
llama.cpp支持支持支持
  • 支持:按可信统计区分缓存输入和普通输入;明确返回缓存数 0 表示未命中,按普通输入价计费。缓存创建也按普通输入计费。
  • 未知(Unknown):框架未提供可信的缓存拆分,平台保留“未知”,全部输入按缓存输入价兜底。这不代表实际全部命中缓存,也不会把缺失统计补成未命中 0。
  • oMLX Messages:没有显式缓存配置时,Provider 会在适用的文本块补齐 cache_control;已有配置保持原样。无法安全补齐或无法确认明细时,仍按未知处理。
  • vLLM:已测环境启用了前缀缓存和 --enable-prompt-tokens-details。使用其他版本或启动配置时,需要确认实际返回的缓存明细,不能仅凭响应变快判断命中。

LM Studio Chat 的临时输入计费规则见 LM Studio 本地模型准备。具体单价以平台模型价格为准。