Claude Sonnet 4.5 已弃用
Anthropic 宣布弃用 claude-sonnet-4-5-20250929,该模型计划于 2026-11-30 从 Claude API 下线,并建议改用 Sonnet 5.5。
模型发布与退役、API 和 SDK 版本、MCP 规范变更及价格调整,了解这些会影响已发布代码的变化。按时间倒序排列,每条均链接到厂商自己的说明。
Anthropic 宣布弃用 claude-sonnet-4-5-20250929,该模型计划于 2026-11-30 从 Claude API 下线,并建议改用 Sonnet 5.5。
OpenAI 发布了面向编程和专业工作的 gpt-6.1-sol,价格为每百万 token 输入 $2 / 缓存输入 $0.10 / 输出 $10(提示词不超过 272K),并在 Responses API 中开启多智能体子智能体委派功能的 beta 测试。
OpenAI 在 DevDay 2026 上宣布推出 Dots 持久化智能体、GPT-6.1 Sol、Ultrafast 速度档、限量预览版 Decisions API、由 OpenAI 提供支持的 Amazon Bedrock Managed Agents,以及 ChatGPT 对 MCP Events 规范草案的支持。
基于 Agents API 构建的智能体现在可以在 OpenAI 托管的浏览器中完成任务;开发者的应用则负责处理网站访问授权和登录。
在 Responses API 中,gpt-6-astra 可通过 service_tier "ultrafast" 调用,价格为每 1M tokens 输入 $60 / 输出 $300(短上下文);仅支持全球和美国数据驻留处理。
claude-sonnet-5-5 已发布,价格为每 MTok $2/$10,支持 1M 上下文和 128K 输出。与 Sonnet 5 相比有五项破坏性变更,其中包括强制使用 tool_choice 会返回 400,以及 Claude API 不再接受 computer_20251124。
对于 stop_details.category 为 bio、frontier_llm 或 reasoning_extraction 的拒绝响应,即使在产生任何输出前就返回,也会再次计费;其他类别的早期拒绝响应仍免费。
OpenClaw 2026.9.6 新增托管更新恢复、30 天用量报告、远程工作区的 Files/Memory/Skills,以及对 Claude Opus 5.5、GPT-6 Sol/Luna 和 Grok 4.7 的聊天模型支持。
OpenAI 在 Responses 和 Chat Completions API 上发布了推理模型 gpt-6-sol($2/$0.20/$10)和 gpt-6-luna($0.10/$0.01/$0.50)。
claude-opus-5-5 已发布,价格为每 MTok $4/$20(低于 Opus 5),支持 1M 上下文、128K 输出和始终开启的自适应思考;思考功能无法关闭,使用计算机则需要 computer_toolset_20260801。
使用 inline-tools-2026-09-15 测试版请求头后,可在对话中途的 system message 中添加或修改工具(包括通过 mcp-client-2026-09-15 添加的 MCP toolsets),且不会使 prompt cache 失效。
grok-4.7 已发布,支持 500K 上下文窗口,价格为输入 $2 / 缓存 $0.50 / 输出 $6(prompt >=200K 时价格翻倍),并支持函数调用和结构化输出;不支持 Batch API。
Google 将 Gemini 2.5 模型的访问权限限制为已使用过这些模型的用户(并未弃用这些模型),并建议新项目使用 Gemini 3.5 Flash-Lite 或 3.8 Flash。
OpenClaw 2026.9.5 新增 Atomic Updates、无需重启 Gateway 即可安装的插件、可共享对话、在会议和通话中使用 GPT Live,以及面向专业 agent 团队的引导式设置。
Google 发布了托管 agent antigravity-preview-09-2026,内置工具改用 PascalCase 命名,并支持按行范围编辑文件;antigravity-preview-05-2026 将于 2026-10-05 停用。
Messages API 可按请求压缩对话(使用 compact-2026-09-04 测试版请求头),并返回一个已签名的压缩块,供后续请求替换较早的消息。
OpenAI 开始公开测试 Agents API,将开源 Codex harness 作为托管服务提供,支持持久会话、MCP/工具、子 agent,以及由 OpenAI 托管、自托管或合作伙伴提供的 sandbox;除 tokens 和工具费用外不收取额外费用。
gpt-live-1 全双工语音会话现已正式可用,价格为每分钟 $0.05(按秒计费);后端模型或 agent 的推理可通过 Responses 或客户端委派。
DeepSeek 发布了多模态模型 V4.1-Flash,模型名为 deepseek-flash;同时下架 V4-Flash 并下调价格(高峰时段输入 $0.30 / 输出 $1.20,非高峰时段减半)。
Claude Managed Agents 新增 auto 权限策略:服务器会评估每次 agent 或 MCP 工具调用,并执行、拒绝或暂停调用以等待审批。
OpenAI 发布了 gpt-6-astra($10/$1/$50),这是其能力最强的模型。新功能包括异步工具调用、通过 WebSockets 在单轮对话中途调整行为,以及在对话过程中更改推理强度;工具调用需要使用 Responses API。
Google 发布了 gemini-3.8-flash,面向长周期软件工程任务和自主 agent;优惠价为每 1M tokens $0.75/$3.75,有效期至 2026-12-31。
Meta 发布了 Muse Spark 1.3,在 Muse Code 和 Meta Model API 中提供最高级别的推理能力,价格为每 1M tokens $1.25/$4.25(贡献者级别为 $0.10/$0.20)。
claude-fable-5-1 上线,价格为每 MTok $10/$50;缓存读取价格降至 $0.25(0.025x),上下文窗口为 1M,最大输出为 128K。Claude Mythos 5.1 也同步向 Project Glasswing 参与者开放;不支持强制设置 tool_choice。
OpenAI API 的双向 TLS 和 X.509 工作负载身份联合功能已正式推出,可在 Platform 控制台中配置。
Assistants API 已停止服务;OpenAI 还宣布 whisper-1 和 gpt-4o transcribe 模型将于 2027-02-26 停止服务。
GPT-5.6 Sol 降至每 1M tokens 输入 $4 / 输出 $20(输入价格降低 20%,输出价格降低 33%)。此促销价格至少持续至 2026-11-21。
Computer use 以 computer_toolset_20260801 的形式结束 beta 阶段(支持批量操作,默认开启缩放);同时推出 browser_toolset_20260801 客户端工具集,Files API 和 Agent Skills/Skills API 也移除了 beta 标记头。
openai-agents-python v0.22.0 已发布,包含运行时加固、guardrail 输出脱敏、provider 选项验证,以及增强的 handoff 图可视化;破坏性变更详见发布说明。
Z.ai 发布了 GLM-5.3(基础模型与 GLM-5.2 相同,经后训练优化),价格为每 1M tokens $1.40/$4.40;现在无法再关闭思考功能。
DeepSeek 发布了正式版 V4-Pro,agent 基准测试表现更强,原生支持 OpenAI Responses API 格式(针对 Codex 进行了适配),并提供 low/high/max 推理强度;高峰/非高峰定价将于 2026-08-16 生效。
Google 发布了 gemini-3.7-flash,面向编码和 agent 工作流,并提供优惠价至 2026-12-31。
claude-agent-sdk v0.2.137 新增了 ConversationResetMessage、消息来源字段,以及 resume_session_at/resume_drops_turn 选项,可安全截断恢复的会话。
Anthropic 取消了原定于 2026-09-01 实施的 $3/$15 涨价,Claude Sonnet 5 继续维持每 MTok $2/$10 的价格。
Claude Managed Agents 会话新增硬性支出上限(达到上限时暂停,并返回 budget_reached)、可供 agent 在一轮对话中途咨询的顾问模型、按 agent 配置的 inference_geo,以及从挂载的 GitHub 仓库自动加载 skills 的功能。
Claude Enterprise 组织现在可以将受管控的 prompt 路由到自有 AI 安全服务器,在推理前获取允许或拒绝的判定;claude-opus-4-1-20250805 已停用。
Alibaba 在 Model Studio 上发布了 Qwen3.8-Max。这款拥有 2.4T 参数、支持 1M 上下文的 MoE 模型,预计将在随后一周开放权重。
Priority processing 更名为 Fast mode(价格为 2 倍,GPT-5.6 Sol 的速度最高提升 2.5 倍);GPT-5.6 Luna 降价 80%,GPT-5.6 Terra 降价 20%。
新版 MCP 修订版移除了 initialize 握手和协议会话,新增必需的 server/discover RPC 和 Multi Round-Trip Request 模式,将 tasks 移至扩展中,并弃用 Roots、Sampling 和 Logging。
claude-opus-5 发布,价格为每 MTok $5/$25,支持 1M 上下文和 128K 输出;同时新增对话中途更改工具的功能(beta),并默认启用服务端回退模式。
旧模型名称 deepseek-chat 和 deepseek-reasoner 计划于当天停用(随 V4 发布于 2026-04-24 公告)。
Google 将 gemini-3.6-flash 和 gemini-3.5-flash-lite 设为正式可用,并弃用 temperature、top_p 和 top_k 采样参数。
Moonshot 在 Kimi API 上发布了 Kimi K3。这款拥有 2.8T 参数、支持 1M 上下文的开放权重 MoE 模型,价格为每 1M tokens $3/$15;权重将于 2026-07-27 前发布。
claude-sonnet-5 发布,支持 1M 上下文并采用新的 tokenizer(token 数量约增加 30%);手动启用 extended thinking 和使用非默认采样参数现在会返回 400。
Google 开放了 Gemini 3.5 Flash 中 Computer Use 工具的公开预览版,支持浏览器、移动设备和桌面环境,提供可配置的安全策略和 prompt injection 检测。
claude-sonnet-4-20250514 和 claude-opus-4-20250514 已停用;现在发送请求会返回错误。
gemini-2.0-flash、gemini-2.0-flash-001、gemini-2.0-flash-lite 和 gemini-2.0-flash-lite-001 已停用,可改用 gemini-3.5-flash 或 gemini-3.1-flash-lite。