天池 Token 网站和引擎
- 2026-09-25: 修复若干调用报错兼容性问题;新增
skypool_usage 开关;“推理”改为“思考”
- 2026-09-20: 新增不计费的 Anthropic Token 计数接口;Chat Completions、Responses、Messages 三协议统一提供
skypool_usage 用量字段;任务绝对超时延长至 30 分钟,修复空启动帧过早触发流式空闲计时,支持按可信累计用量快照结算流式绝对超时;完善 llama.cpp 历史思考内容、Jinja 模板及工具参数解析失败时的受控换节点重试;活动记录保留失败与后续重试关联,新增“失败转发”标记、秒数时长;修复赠金领取鉴权并完善注册邮箱验证;请求因节点或运行时故障失败后清除会话亲和绑定,后续请求恢复普通调度
- 2026-09-15: 优化任务上下文预估;改善模型发现连接失败后的换节点与冷却;支持基于可信运行时用量快照的流式取消结算;修正不支持的视频内容类型错误的调用方归因
- 2026-09-11: Playground 支持 Chat Completions、Responses、Messages 三协议切换,活动记录增加协议标签并优化 Token 统计展示,修复旧版 iOS 邮箱验证兼容性,补充会话级缓存与 AI 编程工具接入说明,恢复 LM Studio 接入入口
- 2026-09-03: 支持缓存输入统计和独立计费,支持 /v1/responses (OpenAI v2) 和 /v1/messages (Anthropic) 推理协议
- 2026-08-31: 优化任务分配和节点上下文大小的关系,优化会话级缓存命中,修复若干 LM Studio 框架和 Agent 协议的兼容性问题,统一思考模式开关兼容性,任务超时提高到20分钟
- 2026-06-01: 优化性能评分、错误分类,更新 Dify 插件市场链接
- 2026-05-29: 供应控制台增加机器名,更新性能评测规则;Skypool 上架 Dify 市场,首页新增动态,并更新 Dify 接入文档推荐使用 Skypool 插件
- 2026-05-22: 控制台运行时模型选择,新增 iOS Web App 支持,优化 iOS 登录回跳、会话刷新和 Cookie 持久化,新增 HuggingFace 和 OpenRouter 专属接口
- 2026-05-18: 修复token速度计算,优化活动记录展示,活动记录增加一些隐藏配置按钮,所有查询设置缓存本地,天池 Playground 若干功能迭代
- 2026-05-14:供应控制台里,性能评分可以点击手动重测,token 消耗可以查看输入输出速度,支持 llama.cpp,更新开发者接入文档和各种三方工具接入文档
- 2026-05-13: 实验室和获取控制台,新增天池 Playground测试平台模型的各种能力
- 2026-05-11: provider v0.3.1 以上版本展示节点的显存和上下文大小
- 2026-05-08: 新增性能测试,60分以上优先分配任务,60~100分获得任务的权重相同。节点断线超过1分钟,连接平台会自动做性能测试。完善任务请求报错提示
- 2026-05-06: 增加节点状态:处理中、待处理,修复若干撮合引擎假死调度和前端节点状态假死问题
- 2026-05-04: 优化节点信息;新增更新日志页面
- 2026-05-03: 优化撮合引擎 prefill 中间帧,增加调用稳定性;Relay lease 功能,大幅增加推理缓存命中;新增 provider 最低版本限制;新增下载页面
天池 Token 供应客户端
v0.6.4(2026-09-25)
- 完善 llama.cpp 运行时版本识别,支持从
/props 构建信息中提取构建号与提交哈希,改善节点版本上报
- 修复新旧 Unsloth 版本的上下文容量识别与准入,兼容隐藏模型路径的返回格式,在预检、启动和心跳时核实当前已加载模型的实际容量,避免模型加载、重载或身份不明确时沿用旧容量
v0.6.3(2026-09-20)
- 新增 Anthropic
POST /v1/messages/count_tokens 支持,llama.cpp、Unsloth、oMLX、vLLM 转发运行时原生计数;需配合支持该能力的平台服务,计数请求不生成内容、不计入生成账单
- 为 LM Studio 提供输入 Token 估算,支持文本、系统消息、工具定义及工具调用历史;使用已加载模型的模板与分词器,不自动加载模型,图片、PDF 等暂不支持的内容会返回明确错误
- 修复仅收到角色、启动事件等空帧时过早进入流式空闲计时的问题,在首个正文、思考或工具输出前保持预填充状态
- 将运行时传输等待上限延长至 31 分钟,配合平台 30 分钟任务时限及清理余量,减少长预填充和非流式请求被传输层提前中断
- 修复模型发现阶段的极早取消竞争,避免取消后迟到的模型列表结果再次发起推理;完善取消、超时和回传失败时的流清理
v0.6.2(2026-09-15)
- 支持 llama.cpp Chat / Responses、vLLM Chat 在调用方取消请求时按已用量结算,其他框架协议暂不支持
- 移除上下文与输出预算的256K软限制,保留运行时实际上报容量及传入的显式输出预算,完善 vLLM 上下文超限识别
- 模型发现阶段发生连接故障时立即暂停接收新任务,已有任务继续执行;健康检查通过后恢复供应,并支持平台安全切换节点
v0.6.1(2026-09-11)
- 恢复 LM Studio 推理框架支持(LM Studio 由于统计接口不完善,所有输入暂时按照非缓存命中计价)
- 优化周期性能力复检:首次失败后立即复检,连续 3 次失败才停止供应,减少短暂异常导致的掉线;复检期间检查运行状态与活跃请求,保护正在处理的任务
- 修复停止供应后桌面端仍显示“等单中”的问题,同步 Agent 实际运行状态,窗口恢复时主动刷新,并展示停止原因与错误信息
- 完善启动预检,核对所选推理框架、接口可访问性及当前模型实际上下文容量,配置不匹配或容量无法核实时给出明确提示
- 完善缓存能力检查,补充 llama.cpp 重复请求缓存预检,兼容 vLLM 部分版本缓存明细缺失的行为,无法确认的缓存用量保留为未知
- 修正 Messages 协议的用量与缓存统计,修复 LM Studio 输入 Token 重复累计,完善 Unsloth 和 oMLX 缓存识别,避免将未经确认的缓存统计当作零命中
- 改善 Unsloth 已加载模型短名与完整仓库名的匹配,减少模型别名误判;鉴权失败时补充 Token 和旧节点状态文件的排查提示
v0.6.0(2026-09-03)
- 支持缓存输入 token 统计,vLLM 需启用 Prefix Caching 与
cached_tokens 明细,oMLX 需通过实际缓存命中校验
- 支持 /v1/responses (OpenAI v2) 和 /v1/messages (Anthropic) 推理协议,
- 新增 Unsloth Desktop 推理框架接入并设为默认框架
- 当前支持的推理框架为 Unsloth Desktop、vLLM、llama.cpp、oMLX;旧版 LM Studio、SGLang、Ollama 配置会自动迁移为 Unsloth Desktop 默认配置
- 仅 Q4 及更高精度允许启动,Q1/Q2/Q3 或无法识别量化等级的 GGUF 会被拒绝
- 优化运行时参数错误分类,统一返回
VALIDATION_ERROR,减少调用方请求错误触发的无意义跨节点重试
- Relay 任务协议统一为 OpenAI 双向透传 V2,移除旧 V1 兼容路径
v0.5.5(2026-09-01)
- 优化任务超时上报,区分首 token 超时、流式空闲超时和绝对超时,便于更准确定位长推理与断流问题
- 为 OpenAI-compatible 流式任务补充首末响应时间、结束原因、usage、
[DONE]、EOF 和语义终止等诊断信息,并随成功或失败终态上报
- 收紧超时重试条件:已产生真实输出或已观察到计费用量的任务不再标记为可重试,降低重复输出和重复计费风险
- 优化 LM Studio 系统消息顺序错误分类:当 system 消息不在开头时,HTTP 与 SSE 场景均返回
VALIDATION_ERROR 并保留原始提示,方便调用方修正请求
- 将 OpenAI-compatible 运行时传输层超时从 10 分钟调整为 21 分钟,由 20 分钟任务硬上限统一收口,并预留 1 分钟清理余量,减少超时边界提前中断
v0.5.4(2026-08-31)
- 增强 LM Studio 工具调用兼容性
- 优化 LM Studio 错误分类
- 修复 OpenAI-compatible 流式请求可能长时间挂起的问题
- 增加运行时上下文容量上报:可区分运行时实测、运行时配置、平台目录回退等来源
- 上下文溢出统一返回 RUNTIME_CONTEXT_CAPACITY_EXCEEDED,并透传所需、实际及可用 token 数。仅在尚未输出内容且没有计费用量时标记为可重试,降低重复输出或重复计费风险
- qwen3.8:27b 启动预检最低上下文严格调整为 128K,当前发布基线推荐值仍为 256K
v0.5.3(2026-08-17)
v0.5.2(2026-06-01)
- 限制图片请求日志的输出体积,避免大图片或长 payload 导致日志和内存膨胀
- 兼容布尔值形式的 reasoning 参数提示,提升不同 OpenAI-compatible 客户端的调用兼容性
- 限制桌面端 Provider 日志缓冲区大小,减少长时间运行时的内存增长
- 桌面窗口隐藏时降低 Provider 日志推送频率,降低后台运行开销
- 优化日志渲染与清理流程,避免大量日志持续积压影响界面响应
v0.5.1(2026-05-29)
- 修复 LM Studio 等 OpenAI-compatible 运行时版本探测,优先读取本地 LM Studio 应用版本,避免把后端引擎版本误上报为应用版本
- 优化运行时版本探测和上下文窗口识别兼容性,覆盖 vLLM、SGLang、oMLX、llama.cpp 等不同接口返回
- 延长 OpenAI-compatible 聊天请求和原始透传请求超时到 10 分钟,减少长推理或首 token 较慢导致的请求中断
- 增加 Relay 断线离线状态防抖与状态代次校验,避免旧的离线更新覆盖已重连状态
- 修复高级配置下拉菜单层级,避免模型、运行时等选择菜单被面板或高级配置项遮挡
v0.5.0(2026-05-21)
- 支持桌面端运行时模型选项,增加 unsloth 等第三方打包优化镜像的选项,可在不同本地推理框架下选择更精确的模型 ID
- 统一 OpenAI-compatible 能力预检,启动时更严格检测文本、图片、工具、推理等能力
- 支持运行时模型 ID 预检,并保留运行时返回的模型上下文窗口信息
- 新增周期性能力复检,节点运行期间模型或框架能力变化后可重新识别
- 修复 Relay 断线重连与接单状态恢复问题,减少重连后状态不同步
- 识别 Provider Relay 状态日志,节点连接状态提示更加准确
- 降低图片预检 prompt token 预算,减少启动预检开销
- 增加桌面端单实例限制,避免重复启动导致多个窗口或 Provider 进程互相影响
v0.4.1(2026-05-18)
- 左下角增加 UI 缩放滑动条
- Windows 版本关闭会隐藏进托盘菜单,右键点击托盘图标关闭
- 优化多项 UI 提示和动画
- 修复2个断线重连可能会导致永久掉线的 bug,现在持续在线更加稳定
- 优化启动时预检图片能力的兼容性
- 修复 AMD GPU 显存识别不准确的问题
- 优化 OpenAI-compatible 运行时错误输出安全性
v0.4.0(2026-05-15)
- 默认推理框架从 Ollama 改为 LMStudio,取消 Others
- 新增
llama.cpp 框架支持
- 加强本地模型自检和最大tokens自检
- 若干服务器连接细节优化
v0.3.1(2026-05-11)
- 新增
LMS tudio 框架支持
- 不再专门支持
KTansformers 框架,归入 Others
- 强制检测模型上下文大小
- 不再支持自定义 “心跳间隔”
- 增加若干节点上报的模型和硬件信息
- 增强 Linux 运行稳定性,减少崩溃
- 增强 OpenAI-compatible 协议容错稳定性
v0.3.0(2026-05-07)
- 支持
vLLM、SGLang、LM Studio、oMLX 等多种推理框架
- 新增 Linux GUI 绿色版
- 新增 API 密钥格式校验
- 新增版本更新弹窗提示
- 保存功能支持框架和配色
- 并发推理默认改为
1
v0.2.0(2026-05-04)
- 新增 macOS .dmg 签名版
- 上报桌面端版本,配合节点列表监控。
- 若干前端优化和 bugfix。
v0.1.1(2026-05-03)