Prezzi AI: le soglie che fanno raddoppiare il conto
Grok 4.6 esce a 2 dollari per milione di token. Ma oltre una soglia l'intera richiesta raddoppia, e tenere i dati in Europa costa il 10% in più.
In sintesi
- Grok 4.6, uscito il 12 agosto, resta a 2 dollari per milione di token in ingresso e 6 in uscita, con contesto da 500.000 token.
- Sopra i 200.000 token di prompt xAI fattura l'intera richiesta a 4 e 12 dollari: una richiesta da 199.000 token costa la metà di una da 200.001.
- Non è un'eccezione: anche il listino OpenAI ha due colonne, contesto breve e contesto lungo, con soglia indicata a 272.000 token.
- Tenere i dati in Europa ha un prezzo esposto a listino: +10% sugli endpoint con elaborazione regionale OpenAI per i modelli usciti dal 5 marzo 2026.
- L'input in cache di Grok è passato da 0,30 a 0,50 dollari per milione: è la voce che decide il costo di un agente, e non compare nei titoli.
Il 12 agosto xAI ha rilasciato Grok 4.6 con la stessa etichetta di prezzo del modello precedente: 2 dollari per milione di token in ingresso, 6 in uscita. È la cifra che finisce nei titoli e nei preventivi. È anche la cifra che, da sola, non dice quasi niente su quanto costerà davvero far girare un assistente in azienda per un mese.
Perché sotto quel numero, nei listini usciti quest'estate, si è formata una struttura a gradini che l'anno scorso non c'era. E i gradini si pagano.
Che cosa ha rilasciato xAI il 12 agosto
Grok 4.6 arriva sull'API di xAI, su Grok Build e su Cursor, e viene rivenduto da OpenRouter, Vercel e Cloudflare. Finestra di contesto da 500.000 token, conoscenza aggiornata al 1° febbraio 2026, quattro livelli di sforzo di ragionamento. Sull'Artificial Analysis Intelligence Index segna 61, alla pari con GPT-5.6 Sol: parità con la frontiera, non superamento — e su DeepSWE e Terminal-Bench resta dietro alla configurazione massima di GPT-5.6 Sol.
Per un'impresa italiana la notizia interessante non è il punteggio. È che un modello di prima fascia costa oggi meno di un terzo del principale concorrente a listino pieno. Se l'anno scorso la scelta del modello era una scelta di qualità, oggi è quasi solo una scelta di conto.
Perché il prezzo di listino non è quello che paghi?
Perché il listino è una tariffa condizionata. Vale finché la richiesta resta sotto una certa dimensione, finché non chiedi che i dati restino in Europa, finché non usi la cache. Superata una qualunque di queste condizioni, cambia la tariffa applicata — e non su una parte della richiesta, ma su tutta.
Che cosa succede quando la richiesta supera la soglia?
Su Grok 4.6 la soglia è a 200.000 token di prompt. Sopra, l'input passa da 2 a 4 dollari per milione e l'output da 6 a 12. Il punto che quasi nessuno legge è come viene applicata: xAI fattura l'intera richiesta alla tariffa alta, non i soli token eccedenti.
Il conto si fa in dieci secondi. Una richiesta da 199.000 token costa circa 0,40 dollari. La stessa richiesta con mille token in più ne costa 0,80. Il doppio, per l'uno per cento di lavoro in più.
Non è una stranezza di xAI. Sul listino ufficiale di OpenAI convivono da mesi due colonne, «short context» e «long context»: GPT-5.6 Sol passa da 5 a 10 dollari in ingresso e da 30 a 45 in uscita, Terra da 2 a 4 e da 12 a 18, Luna da 0,20 a 0,40 e da 1,20 a 1,80. La soglia indicata è 272.000 token. È diventato il modo standard di far pagare il contesto lungo, ed è la ragione per cui il crollo dei prezzi di luglio va riletto con più attenzione di quanta ne meritasse allora.
In azienda la soglia si supera senza accorgersene. Un assistente a cui si allega il manuale di prodotto, un agente che legge la casella di posta di un intero trimestre, un'analisi su venti contratti invece che su due: nessuna di queste operazioni sembra diversa dalle altre a chi la lancia, e tutte possono far scattare la tariffa doppia. La dimensione dell'allegato, in una PMI, non la decide chi ha firmato il contratto.
Quanto costa tenere i dati in Europa?
Il dieci per cento in più, se il fornitore è OpenAI. La pagina dei prezzi lo scrive testualmente: gli endpoint con elaborazione regionale hanno un sovrapprezzo del 10% per i modelli usciti dal 5 marzo 2026 in avanti. Su GPT-5.6 Terra l'input passa da 2 a 2,20 dollari, l'output da 12 a 13,20.
È una cifra piccola e una notizia grande. Per la prima volta la residenza dei dati ha un prezzo esposto a listino, invece di essere una clausola contrattuale. Significa che nel momento in cui un'impresa italiana decide dove far girare l'assistente, quella scelta smette di essere solo giuridica e diventa una voce di costo confrontabile — e quindi comprimibile da chi guarda solo il totale. Vale la pena metterlo nero su bianco nel registro degli strumenti AI, accanto al fornitore e alla finalità: dove vengono elaborati i dati, e a che prezzo.
La cache fa risparmiare o sposta solo il problema?
Fa risparmiare, ma è la voce che si muove più in fretta. Su Grok 4.6 l'input in cache costa 0,50 dollari per milione: il 67% in più dei 0,30 di Grok 4.5, secondo l'analisi di DigitalApplied. Il prezzo in prima pagina è rimasto identico, quello che cambia il conto di un agente è cresciuto di due terzi.
E la cache non è un dettaglio da sviluppatori: è esattamente il meccanismo su cui girano gli agenti, che rileggono lo stesso contesto a ogni passo. Un flusso costruito quando la cache costava 0,30 ha un'economia diversa oggi, a parità di codice e di volumi. Se l'assistente aziendale gira su Cursor o su un altro strumento che include un budget in dollari sui modelli, quel budget si consuma più in fretta senza che sia cambiato nulla nel modo di lavorare.
Come si legge un preventivo AI senza sorprese
Quattro domande, tutte con risposta numerica.
Quanti token entrano nella richiesta tipo, e qual è il caso peggiore? Se il fornitore non sa rispondere, non ha misurato. La soglia del contesto lungo si difende con un tetto sulla dimensione degli allegati e con il recupero mirato dei documenti, non con la buona volontà.
Il preventivo è a conversazione o a consumo? Sono due rischi diversi: nel primo il fornitore assorbe lo scatto, nel secondo lo assorbi tu. È la stessa distinzione che regge le tre voci del prezzo di un chatbot.
Dove vengono elaborati i dati, e quel prezzo è già dentro la cifra? Con il sovrapprezzo del 10% ora si può chiedere in modo preciso.
Che cosa succede quando il credito finisce: il sistema si ferma o continua a fatturare? Sono le due filosofie che dividono il mercato, e in azienda cambia tutto.
Serve cambiare modello?
Quasi sempre no, ed è la conclusione meno di moda. Un modello a 2 dollari che raddoppia sopra soglia non è più caro di uno a 5 che raddoppia anche lui: dipende da come sono fatte le vostre richieste, e questo lo dice solo la misura. Cambiare fornitore per un titolo di giornale costa più del delta che si insegue.
La domanda utile non è quale modello costa meno. È se qualcuno, in azienda, sa dire quanti token consuma la richiesta tipo. Finché non lo si sa, ogni preventivo è una scommessa — e l'alternativa di far girare il modello in sede sposta la spesa sull'hardware, non la elimina.
Domande frequenti
Grok 4.6 costa davvero meno di GPT-5.6?
A listino pieno sì: 2 dollari per milione di token in ingresso contro i 5 di GPT-5.6 Sol, 6 in uscita contro 30. Ma il confronto regge solo finché le richieste restano sotto la soglia del contesto lungo, dove entrambi raddoppiano o quasi. Il costo reale dipende da quanto sono grandi le vostre richieste.
Che cos'è la soglia del contesto lungo?
È la dimensione del prompt oltre la quale scatta una tariffa più alta. Su Grok 4.6 è a 200.000 token, sul listino OpenAI è indicata a 272.000. In entrambi i casi la tariffa alta si applica a tutti i token della richiesta, non solo a quelli che superano la soglia.
Tenere i dati in Europa costa di più?
Con OpenAI sì, ed è scritto a listino: gli endpoint con elaborazione regionale hanno un sovrapprezzo del 10% per i modelli usciti dal 5 marzo 2026 in avanti. Su GPT-5.6 Terra significa 2,20 dollari invece di 2 in ingresso. È un costo, non una clausola: va chiesto e messo nel preventivo.
Come si evita la tariffa doppia in azienda?
Misurando. Serve sapere quanti token consuma la richiesta tipo e qual è il caso peggiore, poi mettere un tetto alla dimensione degli allegati e recuperare solo i documenti pertinenti invece di caricare l'intero archivio a ogni domanda. Senza quella misura, ogni preventivo a consumo è una scommessa.