Claude Sonnet 4.5 ritirato
Anthropic ha annunciato il ritiro di claude-sonnet-4-5-20250929: il ritiro dalle Claude API è previsto per il 2026-11-30 e Sonnet 5.5 è il sostituto consigliato.
Lanci e ritiri di modelli, release di API e SDK, modifiche alle specifiche MCP e variazioni di prezzo che incidono sul codice già distribuito. Dalle novità più recenti alle meno recenti; ogni voce rimanda alle note del vendor.
Anthropic ha annunciato il ritiro di claude-sonnet-4-5-20250929: il ritiro dalle Claude API è previsto per il 2026-11-30 e Sonnet 5.5 è il sostituto consigliato.
OpenAI ha rilasciato gpt-6.1-sol per la programmazione e il lavoro professionale, al prezzo di $2 per l'input / $0.10 per la cache / $10 per l'output (prompt <=272K), con delega a subagent multi-agente in beta nella Responses API.
Al DevDay 2026, OpenAI ha annunciato gli agenti persistenti Dots, GPT-6.1 Sol, il livello di velocità Ultrafast, l'anteprima limitata della Decisions API, Amazon Bedrock Managed Agents con tecnologia OpenAI e il supporto di ChatGPT alla bozza delle specifiche MCP Events.
Gli agenti basati sulla Agents API possono ora completare attività in un browser ospitato da OpenAI, mentre l'applicazione dello sviluppatore gestisce le autorizzazioni per accedere ai siti web e l'autenticazione.
gpt-6-astra può essere chiamato con service_tier "ultrafast" nella Responses API a $60 per l’input / $300 per l’output ogni 1M token (contesto breve), con elaborazione solo nelle regioni globali e statunitensi per la residenza dei dati.
claude-sonnet-5-5 è stato lanciato a $2/$10 per MTok, con contesto da 1M e output da 128K. Include cinque modifiche incompatibili rispetto a Sonnet 5, tra cui tool_choice forzato che restituisce 400 e il mancato supporto di computer_20251124 nella Claude API.
I rifiuti che arrivano prima di qualsiasi output tornano a essere fatturati quando stop_details.category è bio, frontier_llm o reasoning_extraction; i rifiuti anticipati nelle altre categorie restano gratuiti.
OpenClaw 2026.9.6 aggiunge il ripristino degli aggiornamenti gestiti, i report sull’utilizzo degli ultimi 30 giorni, Files/Memory/Skills negli spazi di lavoro remoti e il supporto dei modelli di chat Claude Opus 5.5, GPT-6 Sol/Luna e Grok 4.7.
OpenAI ha rilasciato i modelli di ragionamento gpt-6-sol ($2/$0.20/$10) e gpt-6-luna ($0.10/$0.01/$0.50) nelle API Responses e Chat Completions.
claude-opus-5-5 è stato lanciato a $4/$20 per MTok (meno costoso di Opus 5), con contesto da 1M, output da 128K e adaptive thinking sempre attivo; il thinking non può essere disabilitato e l’uso del computer richiede computer_toolset_20260801.
Con l’header beta inline-tools-2026-09-15, è possibile aggiungere o modificare tool (inclusi gli insiemi di tool MCP tramite mcp-client-2026-09-15) in un messaggio di sistema a metà conversazione, senza invalidare la prompt cache.
grok-4.7 è stato lanciato con una finestra di contesto da 500K, al costo di $2 per l’input / $0.50 per i token in cache / $6 per l’output (tariffe raddoppiate per prompt >=200K), function calling e output strutturati; l’API Batch non è supportata.
Google ha limitato l’accesso ai modelli Gemini 2.5 agli utenti che li avevano già utilizzati (senza deprecarli) e ha indicato Gemini 3.5 Flash-Lite o 3.8 Flash per i nuovi progetti.
OpenClaw 2026.9.5 introduce gli aggiornamenti atomici, plugin installabili senza riavviare il Gateway, conversazioni condivisibili, GPT Live per riunioni e chiamate e una configurazione guidata per team di agenti specializzati.
Google ha rilasciato l’agente gestito antigravity-preview-09-2026, con tool integrati rinominati in PascalCase e modifiche ai file per intervalli di righe; antigravity-preview-05-2026 verrà dismesso il 2026-10-05.
La Messages API può compattare una conversazione su richiesta (header beta compact-2026-09-04) e restituisce un blocco di compattazione firmato che sostituisce i messaggi precedenti nelle richieste successive.
OpenAI ha lanciato Agents API in beta pubblica, offrendo l’harness open source di Codex come servizio gestito con sessioni persistenti, MCP/tool, subagent e sandbox ospitate da OpenAI, self-hosted o fornite da partner, senza costi aggiuntivi oltre a token e tool.
Le sessioni vocali full-duplex di gpt-live-1 sono diventate generalmente disponibili a $0.05 al minuto (fatturazione al secondo), con il ragionamento del modello o dell’agente delegato al backend tramite Responses o il client.
DeepSeek ha rilasciato il modello multimodale V4.1-Flash con il nome deepseek-flash, ritirato V4-Flash e ridotto i prezzi (picco: $0.30 in / $1.20 out; fuori picco, la metà).
Claude Managed Agents ha introdotto una policy di autorizzazione auto: il server valuta ogni chiamata dell'agente o a uno strumento MCP, quindi la esegue, la rifiuta o mette in pausa l'esecuzione in attesa di approvazione.
OpenAI ha rilasciato gpt-6-astra ($10/$1/$50), il suo modello più capace, aggiungendo chiamate asincrone agli strumenti, controllo dell'esecuzione a metà turno tramite WebSockets e modifiche al livello di reasoning effort durante la conversazione; per chiamare gli strumenti è necessaria la Responses API.
Google ha rilasciato gemini-3.8-flash, pensato per attività di ingegneria del software a lungo termine e agenti autonomi, al prezzo promozionale di $0.75/$3.75 per 1M tokens fino al 2026-12-31.
Meta ha rilasciato Muse Spark 1.3 con il reasoning massimo su Muse Code e sulla Meta Model API, al prezzo di $1.25/$4.25 per 1M tokens (livello contributor: $0.10/$0.20).
claude-fable-5-1 è stato lanciato al prezzo di $10/$50 per MTok, con letture dalla cache ridotte a $0.25 (0.025x), una finestra di contesto di 1M e output di 128K. È stato annunciato anche Claude Mythos 5.1 per i partecipanti a Project Glasswing; tool_choice forzato non è supportato.
La federazione delle identità dei workload tramite Mutual TLS e X.509 è diventata generalmente disponibile per l'API OpenAI ed è configurabile nella console Platform.
Assistants API è stata dismessa; OpenAI ha inoltre annunciato che whisper-1 e i modelli gpt-4o transcribe saranno dismessi il 2027-02-26.
Il prezzo di GPT-5.6 Sol è sceso a $4 per l'input e $20 per l'output per 1M tokens (riduzioni rispettivamente del 20% e del 33%); il prezzo promozionale sarà disponibile almeno fino al 2026-11-21.
Computer use è uscito dalla beta come computer_toolset_20260801 (azioni in batch, zoom attivo per impostazione predefinita); è stato lanciato il client toolset browser_toolset_20260801 e sono stati rimossi gli header beta da Files API e Agent Skills/Skills API.
openai-agents-python v0.22.0 introduce miglioramenti alla robustezza del runtime, la redazione degli output dei guardrail, la convalida delle opzioni dei provider e una visualizzazione ampliata del grafo degli handoff. Le modifiche incompatibili sono elencate nelle note di rilascio.
Z.ai ha rilasciato GLM-5.3 (basato sullo stesso modello di GLM-5.2, migliorato tramite post-training) al prezzo di $1.40/$4.40 per 1M tokens; non è più possibile disattivare il thinking.
DeepSeek ha rilasciato V4-Pro in GA, con risultati migliori nei benchmark per agenti, supporto nativo per il formato OpenAI Responses API (adattato per Codex) e livelli di effort low/high/max. Ha inoltre annunciato tariffe di picco e fuori picco, in vigore dal 2026-08-16.
Google ha rilasciato gemini-3.7-flash per la programmazione e i workflow agentici, a un prezzo introduttivo valido fino al 2026-12-31.
claude-agent-sdk v0.2.137 ha aggiunto ConversationResetMessage, i campi di origine dei messaggi e le opzioni resume_session_at/resume_drops_turn per troncare in sicurezza le sessioni riprese.
Anthropic ha annullato l'aumento previsto per il 2026-09-01 a $3/$15, mantenendo Claude Sonnet 5 a $2/$10 per MTok.
Le sessioni di Claude Managed Agents supportano ora limiti di spesa rigidi (con pausa e stato budget_reached), un modello advisor consultabile dall'agent durante un turno, inference_geo per singolo agent e il caricamento automatico delle skill dai repository GitHub montati.
Le organizzazioni Claude Enterprise possono instradare i prompt soggetti a policy al proprio server di sicurezza AI per ottenere un esito di autorizzazione o rifiuto prima dell'inferenza; claude-opus-4-1-20250805 è stato ritirato.
Alibaba ha lanciato Qwen3.8-Max su Model Studio: un MoE da 2.4T parametri con contesto da 1M, con i pesi open previsti per la settimana successiva.
Priority processing è stato rinominato Fast mode (prezzo 2x, velocità fino a 2.5x per GPT-5.6 Sol); GPT-5.6 Luna costa l'80% in meno e GPT-5.6 Terra il 20% in meno.
La nuova revisione di MCP elimina l'handshake initialize e le sessioni di protocollo, aggiunge una RPC server/discover obbligatoria e il pattern Multi Round-Trip Request, sposta i task in un'estensione e rende obsoleti Roots, Sampling e Logging.
claude-opus-5 è stato lanciato a $5/$25 per MTok, con contesto da 1M e output da 128K, modifiche agli strumenti durante la conversazione (beta) e una modalità di fallback lato server attiva per impostazione predefinita.
I nomi dei modelli legacy deepseek-chat e deepseek-reasoner dovevano essere ritirati in questa data (annunciato il 2026-04-24 con il lancio di V4).
Google ha reso disponibili gemini-3.6-flash e gemini-3.5-flash-lite e ha deprecato i parametri di sampling temperature, top_p e top_k.
Moonshot ha lanciato Kimi K3 sull'API Kimi a $3/$15 per 1M di token: un MoE open-weight da 2.8T parametri con contesto da 1M; i pesi saranno rilasciati entro il 2026-07-27.
claude-sonnet-5 è stato lanciato con contesto da 1M e un nuovo tokenizer (circa il 30% di token in più); il thinking esteso manuale e i parametri di sampling non predefiniti ora restituiscono 400.
Google ha lanciato un'anteprima pubblica del tool Computer Use in Gemini 3.5 Flash, con ambienti browser, mobile e desktop, policy di sicurezza configurabili e rilevamento delle prompt injection.
claude-sonnet-4-20250514 e claude-opus-4-20250514 sono stati ritirati; le richieste ora restituiscono errori.
gemini-2.0-flash, gemini-2.0-flash-001, gemini-2.0-flash-lite e gemini-2.0-flash-lite-001 sono stati dismessi. I modelli sostitutivi sono gemini-3.5-flash o gemini-3.1-flash-lite.