L'AI a consumo smette di costare meno: il conto del 2027
Server Nvidia oltre il 15% in più, Gemini Flash che raddoppia il 1° gennaio, memoria scarsa fino al 2028: cosa mettere a budget in una PMI.
In sintesi
- Nvidia ha avvisato Microsoft, Google e Oracle che i server con chip AI costeranno oltre il 15% in più sui sistemi in spedizione dall'inizio del 2027.
- Gemini 3.7 Flash passa da 0,75 a 1,50 dollari per milione di token in ingresso e da 3,75 a 7,50 in uscita il 1° gennaio 2027: è già a listino, non è una previsione.
- La carenza di memoria si aggrava nel 2027 e non si attenua prima della seconda metà del 2028: non è un picco da aspettare rimandando gli acquisti.
- Il numero da calcolare è il costo per operazione, ricavato dalle ultime tre fatture diviso per le operazioni realmente eseguite.
- A budget 2027 va iscritta la spesa AI attuale raddoppiata: se il progetto non regge quella cifra, reggeva solo grazie a uno sconto introduttivo.
Il 23 agosto Bloomberg ha riportato che Nvidia ha avvisato i suoi clienti più grandi — Microsoft, Google, Oracle — che i server con chip AI costeranno in molti casi oltre il 15% in più. Non è un rincaro generico: riguarda i sistemi Grace Blackwell e Vera Rubin in spedizione dall'inizio del 2027, e la causa dichiarata è una sola, la memoria.
Due giorni prima, il 21 agosto, Amazon aveva ritoccato in silenzio i listini dei suoi dispositivi. Echo Dot da 49,99 a 79,99 dollari, il 60% in più. Fire TV Stick 4K Max da 59,99 a 84,99. Kindle da 109,99 a 149,99. La spiegazione data dall'azienda a Fortune è testuale: «L'industria dell'elettronica di consumo sta affrontando aumenti significativi nei costi dei componenti di memoria e archiviazione. Dopo aver assorbito questi aumenti il più a lungo possibile, abbiamo recentemente adeguato i prezzi».
Che i computer aziendali costino di più lo abbiamo già scritto a inizio agosto. La notizia di questa settimana è un'altra, e riguarda una voce di spesa diversa: il rincaro sta arrivando alla parte di AI che una PMI non compra ma affitta. Il costo per token.
Perché il prezzo dei server AI aumenta del 15%?
Perché in un server AI la memoria non è un accessorio, è metà del prodotto. Una GPU Rubin arriva a 288 GB di HBM4 per package e un rack NVL72 supera i 20 TB di memoria ad alta banda. Quando il prezzo contrattuale della DRAM sale del 58-63% in un trimestre, quel costo non si assorbe: si sposta a valle.
Lo si vede anche sul banco del negozio, dove il meccanismo è identico ma il ritardo è più corto: un modulo DDR5 di fascia consumer che nell'agosto 2025 stava fra i 110 e i 140 dollari, nell'agosto 2026 viaggia intorno ai 392. J.P. Morgan calcola che dall'inizio del 2024 alla fine del 2026 i prezzi DRAM saranno saliti di oltre il 400%.
Chi compra i server, però, non è la PMI. Sono i tre o quattro fornitori a cui la PMI paga un abbonamento o un consumo mensile. Ed è lì che il conto ricompare.
Il listino che raddoppia da solo il 1° gennaio
Gemini 3.7 Flash è uscito con uno sconto introduttivo del 50%: 0,75 dollari per milione di token in ingresso, 3,75 in uscita, 0,075 per il caching di contesto. Lo sconto scade il 31 dicembre 2026. Dal 1° gennaio 2027 il listino pieno è 1,50 e 7,50, con il caching a 0,15.
Il doppio, esattamente. E non è una previsione di mercato: è già scritto nella pagina dei prezzi di Google, da mesi. Chi in queste settimane ha costruito un'automazione su Flash proprio perché costava poco ha poco più di quattro mesi per rifare i conti, e la data non dipende da nessuna trattativa.
Non è un caso isolato. A metà agosto DeepSeek ha alzato i prezzi delle sue API fino a undici volte, e pochi giorni prima avevamo visto come le soglie contrattuali facciano raddoppiare il conto senza che il prezzo unitario cambi di un centesimo. Tre segnali diversi che vanno nella stessa direzione: la fase in cui il costo per token scendeva ogni trimestre è finita, e la scheda di ogni strumento in directory va riletta con questa lente.
Quanto costa davvero un'automazione AI in una PMI?
Quasi nessuno lo sa con precisione, ed è il problema vero. Il costo per token resta invisibile finché la fattura sta sotto i cento euro al mese: nessuno la apre. Ma un flusso che classifica trecento email al giorno consuma un volume perfettamente calcolabile, e quel volume nel 2027 costerà il doppio a parità di lavoro.
Il calcolo si fa in venti minuti e non richiede strumenti. Si prendono le ultime tre fatture di ogni servizio AI a consumo, si divide l'importo per il numero di operazioni realmente eseguite nel periodo — email lette, preventivi generati, chiamate trascritte — e si ottiene un costo per operazione. È l'unico numero che permette di rispondere alla domanda che conta: se questa cifra raddoppia, l'automazione ha ancora senso?
Vale la pena farlo per ogni flusso in produzione su n8n o Make, perché è esattamente lì che si accumulano le chiamate dimenticate: il ramo di test lasciato attivo, il modello grande usato per un compito che ne chiedeva uno piccolo, il retry automatico che ripete la stessa richiesta tre volte. Se in azienda non esiste ancora un elenco degli strumenti AI attivi e di chi li paga, la guida all'inventario degli strumenti è il punto di partenza: senza quell'elenco il calcolo non si può nemmeno impostare.
La memoria non torna abbondante prima del 2028
Questa è la parte che cambia la natura della decisione. IDC stima per il 2026 una crescita della fornitura di DRAM del 16% su base annua e di NAND del 17%, «ben al di sotto delle norme storiche», e prevede per i PC un aumento del prezzo medio fra il 4% e l'8% con una contrazione del mercato fino all'8,9% nello scenario pessimista.
Wallace Kou, amministratore delegato di Silicon Motion, è più netto: la carenza globale di memoria si aggraverà nel 2027, l'attenuazione non comincerà prima della seconda metà del 2028 e i prezzi resteranno alti per due o tre anni. Il fattore che indica come principale responsabile non è l'addestramento dei modelli, ma l'inferenza — cioè proprio l'uso quotidiano che ne fa un'azienda.
Tradotto: non è un picco da aspettare seduti rimandando gli acquisti di sei mesi. È un livello di prezzo nuovo che resta lì per almeno due esercizi, e va messo a bilancio come tale.
Cosa mettere a budget adesso?
Due numeri, non uno. Il primo è la spesa mensile attuale di ogni servizio AI a consumo, letta in fattura e non stimata a memoria. Il secondo è lo stesso numero raddoppiato, iscritto come voce di previsione per il 2027. Se la seconda cifra rende il progetto insostenibile, quel progetto stava in piedi solo grazie a uno sconto.
Da qui discendono tre mosse concrete. La prima: nei contratti di fornitura AI in scadenza, chiedere per iscritto quanto preavviso è dovuto in caso di variazione di listino — nella maggior parte delle condizioni standard sono trenta giorni, che per un'automazione in produzione non bastano a cambiare fornitore.
La seconda: rinviare la sostituzione dei modelli grandi con quelli piccoli non conviene più. Fino a ieri era un'ottimizzazione da fare quando c'era tempo, perché tanto i prezzi scendevano; da oggi è la principale leva di risparmio disponibile, e agisce su una base di costo che sta salendo.
La terza: se c'era in programma un acquisto hardware — un NAS, un server, un rinnovo del parco PC — anticiparlo ha un senso economico che dodici mesi fa non aveva. Non per accaparramento, ma perché i listini dei produttori si aggiornano a gennaio e la direzione è nota.
Il punto di fondo è semplice. Per tre anni il calcolo di convenienza di un progetto AI si è potuto fare al ribasso, dando per scontato che il costo unitario di domani sarebbe stato più basso di quello di oggi. Quella assunzione, dal 1° gennaio 2027, non regge più. Chi rifà i conti adesso ha quattro mesi per decidere con calma; chi li rifà a gennaio li rifarà davanti a una fattura già arrivata.
Domande frequenti
Il raddoppio di Gemini Flash dal 1° gennaio 2027 è certo o è una previsione?
È certo e già pubblicato: 0,75 e 3,75 dollari per milione di token sono una tariffa introduttiva valida fino al 31 dicembre 2026, il listino pieno è 1,50 e 7,50. Non serve nessuna comunicazione da parte di Google perché entri in vigore.
Se uso solo ChatGPT o Claude con abbonamento mensile, il problema mi riguarda?
Meno nell'immediato, perché l'abbonamento a postazione assorbe la variazione fino al rinnovo. Ma il costo dei server sale per tutti i fornitori: la leva che hanno è alzare il prezzo, ridurre i limiti d'uso o spostare funzioni su piani superiori. Conviene rileggere le condizioni di rinnovo.
Conviene passare a un modello aperto installato in azienda per evitare il rincaro?
Solo se avete già l'hardware. Comprarlo adesso significa pagare la stessa carenza di memoria all'origine, con in più la gestione a carico vostro. La leva efficace nell'immediato è un'altra: usare modelli più piccoli dove il compito lo consente.
Quanto preavviso deve darmi un fornitore AI prima di aumentare i prezzi?
Dipende dal contratto e va verificato voce per voce: nelle condizioni standard dei servizi a consumo il preavviso tipico è di trenta giorni, spesso comunicato via email o solo con un aggiornamento della pagina dei prezzi. Per un'automazione in produzione è un margine molto stretto.
Fonti
- Nvidia reportedly warns biggest customers of 15% price hikes on AI servers — Tom's Hardware, 23 agosto 2026
- Amazon quietly hiked prices on Echo, Fire TV, Kindle and eero to offset 'significant increases' in memory costs — Fortune, 21 agosto 2026
- Google's Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut — VentureBeat
- The AI-Driven Memory Shortage: DRAM Prices, Inflation and Market Risks — J.P. Morgan Global Research
- Global Memory Shortage Crisis: Potential Impact on the Smartphone and PC Markets in 2026 — IDC
- Memory shortage to worsen in 2027 as AI inference strains supply, Silicon Motion CEO says — DIGITIMES, 21 luglio 2026
- Amazon raises Echo, Kindle, Fire TV and eero prices by up to 60%, blaming the memory crunch — TechSpot