模型能力

即使模型共用一个 API 端点,能力也可能不同。模型详情页和公开模型 Schema 是所选模型能力的权威来源。

集成前阅读模型页

重点检查:

  • 输入与输出模态:文本、图片、音频或视频。
  • 上下文与输出限制:已公开的最大输入和生成输出。
  • 支持参数:模型接受的字段以及允许的范围或枚举值。
  • 定价规则:Token、图片、字符、秒数等计费单位。
  • 示例:与 Playground 共用公开参数 Schema 生成的请求体。

也可以通过 GET /public/models 查询在线目录。不要只根据供应商或模型家族名称硬编码能力。

工具与函数调用

对于声明支持工具的模型:

  1. tools 中发送工具定义。
  2. 在应用中执行模型返回的工具调用。
  3. 将完整的 assistant 工具调用消息加入历史。
  4. 使用匹配的 call ID 加入工具结果。
  5. 发送更新后的历史,取得最终模型响应。

必须原样保留工具调用 ID 和参数。普通 stop 与工具调用 finish reason 代表不同的应用状态。如果模型页未声明工具支持,不要假设路由器会模拟该能力。

结构化输出

支持 response_format 的模型可以返回 JSON Object 或受 JSON Schema 约束的结果。即使启用了严格结构化输出,应用仍应校验最终内容。

流式响应中,应先缓冲完整 JSON 再解析。单个 delta 只是片段,本身可能不是合法 JSON。

推理模型

推理字段、effort 控制、摘要和 Token 计量因模型和协议而异。继续多轮对话时:

  • 保留协议要求的完整 assistant 响应字段;
  • 原样回传,不要重命名厂商定义的 wire 字段;
  • 除非响应契约明确标记为可展示,否则不要向最终用户暴露隐藏推理;
  • 如果推理 Token 按输出计价,成本估算时必须包含它们。

多模态输入

根据模型不同,输入可以是 URL、Base64、上传文件或 Token360 资产引用。请在模型页确认:

  • MIME 类型与文件限制;
  • 远程 URL 是否必须为公开 HTTPS 地址;
  • 图片位置支持单图还是多参考图;
  • asset:// 引用是否要求特定资产分组类型;
  • 输出的签名 URL 是否会过期。

Real Face 和 Virtual Portrait 还有身份、供应商与资产状态要求,请遵循各自的专门指南。

流式响应

流式能力取决于端点和模型。应用必须处理:

  • 内容 delta;
  • 支持时的工具调用或推理 delta;
  • 最终 finish reason;
  • 返回时的最终 usage;
  • [DONE] 前的错误事件或连接关闭。

除非应用能够安全保存部分结果,否则应将中断的流视为失败。

能力验收清单

模型进入生产前,请使用准确的公开模型名测试:

  • 最小合法请求;
  • 计划使用的每个特殊参数;
  • 一个非法值,以验证错误处理;
  • 适用时的流式与非流式;
  • 适用时的工具调用或结构化输出;
  • 包含上一轮原始 assistant 字段的第二轮请求;
  • 预期的用量与计费字段。
此页面对您有帮助吗?