llms.txt è un file di testo in formato Markdown posizionato nella directory principale di un sito web (es. https://esempio.com/llms.txt). La sua funzione è fornire ai modelli linguistici di grandi dimensioni (LLM) — come ChatGPT, Claude, Gemini e Perplexity — una panoramica strutturata e curata dei contenuti più importanti del sito.
In pratica, llms.txt è una mappa concettuale del sito pensata per l’intelligenza artificiale, non per gli utenti umani né per i motori di ricerca tradizionali. Un file llms.txt tipico contiene:
- Il nome del sito o del progetto (intestazione H1)
- Una breve descrizione (in formato blockquote)
- Le sezioni principali organizzate per categoria (H2)
- Un elenco di link curati alle pagine più importanti, con descrizioni di una riga
- Una sezione
## Optionalper i contenuti accessori
La specifica originale, pubblicata su llmstxt.org da Jeremy Howard (co-fondatore di Answer.AI e fast.ai) il 3 settembre 2024, è volutamente minimale: l’unico elemento obbligatorio è l’H1 con il nome del progetto.
Ricorda: llms.txt è il primo standard B2A (Business-to-Agent) del web. Non è un file SEO, è un file di routing per agenti AI.
Indice dei Contenuti
- A cosa serve llms.txt: il problema che risolve
- llms.txt vs robots.txt vs sitemap: tabella di confronto
- llms.txt SEO: serve per il ranking Google?
- llms.txt e Google: la posizione contraddittoria del 2026
- llms.txt e AI Overviews: impatta davvero?
- Chi usa llms.txt oggi: piattaforme e adozione
- I dati 2026: cosa dicono i log dei server
- llms.txt B2A: perché NON è SEO (spiegato semplice)
- Vale la pena implementare llms.txt? Pro e contro
- Casi d’uso per settore: dove ha senso davvero
- Alternative a llms.txt: HTML parsing, structured data, MCP
- Come fare un file llms.txt: guida step-by-step
- Step 1 — Decidi il perimetro
- Step 2 — Identifica le pagine canoniche
- Step 3 — Raggruppa in 4-7 sezioni
- Step 4 — Scrivi H1, blockquote e descrizioni
- Step 5 — Decidi se aggiungere llms-full.txt
- Step 6 — Carica il file alla root
- Step 7 — Allinea robots.txt
- Step 8 — Testa con un agente reale
- Step 9 — Strumenta il CDN
- Step 10 — Aggiorna trimestralmente
- Errori SEO comuni su llms.txt (cosa NON fare)
- Anti-pattern tecnici (errori di implementazione)
- Come misurare i risultati
- Cosa aspettarsi nei prossimi 12 mesi
- FAQ – Domande frequenti su llms.txt
- Sintesi finale: pubblicare o no llms.txt nel 2026?
- Risorse e fonti
Perché Markdown e non HTML
llms.txt usa Markdown per una ragione tecnica precisa: i file Markdown sono computazionalmente efficienti per gli LLM. L’HTML moderno è pieno di rumore (navigazione, JavaScript, CSS, tracking) che consuma token senza valore informativo. Test condotti da Wix con il tokenizer di OpenAI mostrano che la versione llms.txt di llmstxt.org richiede 95 volte meno token rispetto all’HTML equivalente.
A cosa serve llms.txt: il problema che risolve
llms.txt risolve un problema tecnico specifico: i modelli linguistici hanno finestre di contesto limitate e non riescono a processare interi siti web in un singolo passaggio. Quando un LLM cerca di estrarre informazioni da pagine web standard, deve digerire HTML, CSS, JavaScript, banner e menu di navigazione che consumano spazio prezioso nel contesto.
Il problema è particolarmente critico in tre scenari:
Documentazione tecnica. Assistenti di coding come Cursor o Claude Code che devono consultare la documentazione di un’API. Senza llms.txt l’agente fetcha pagine HTML rumorose; con llms.txt accede a un indice curato delle risorse rilevanti.
Retrieval-augmented generation (RAG). Quando un motore AI deve “fondare” una risposta su contenuti web aggiornati, llms.txt fornisce un punto di ingresso ottimizzato che riduce l’attrito di parsing.
Agenti autonomi. Browser agent, MCP server, shopping agent e altri sistemi agentici che agiscono per conto dell’utente hanno bisogno di superfici machine-readable per navigare i siti efficacemente.
Frase chiave: gli agenti AI usano llms.txt, i motori di ricerca classici no. È la distinzione fondamentale per capire il 2026.
llms.txt vs robots.txt vs sitemap: tabella di confronto
Capire le differenze è il primo passo per evitare confusione strategica:
| Caratteristica | robots.txt | sitemap.xml | llms.txt |
|---|---|---|---|
| Anno | 1994 | 2005 | 2024 |
| Scopo | Controllo accesso crawler | Elenco URL per indicizzazione | Indice curato per AI |
| Formato | Plain text | XML | Markdown |
| Posizione | Root del dominio | Root del dominio | Root del dominio |
| Target | Tutti i crawler | Motori di ricerca | LLM e agenti AI |
| Standard formale | Sì (IETF RFC 9309, 2022) | Sì (sitemaps.org) | No (community) |
| Adozione | Universale | Quasi universale | ~10% (maggio 2026) |
| Influenza SEO | Sì | Sì | No |
llms.txt non sostituisce robots.txt né sitemap.xml: complementa entrambi. robots.txt regola chi può accedere a cosa; sitemap.xml elenca tutte le pagine da indicizzare; llms.txt indica cosa conta davvero fra le pagine accessibili e indicizzate.
llms.txt SEO: serve per il ranking Google?
Risposta diretta: no. llms.txt non è un fattore di ranking SEO nel 2026.
Né nei motori di ricerca tradizionali, né nelle AI Overviews di Google. Quattro studi indipendenti convergono su questa conclusione.
Le quattro evidenze quantitative
SE Ranking (marzo 2026) ha analizzato 300.000 domini per verificare la correlazione fra presenza di llms.txt e citazioni nei modelli AI. Risultato: il tasso di adozione è del 10,13%, ma quando i ricercatori hanno aggiunto la variabile llms.txt al loro modello predittivo XGBoost, le performance del modello sono peggiorate. Il file aggiungeva rumore, non segnale.
OtterlyAI (90 giorni di osservazione) ha misurato il traffico verso un sito che aveva implementato correttamente llms.txt. Su 62.100 richieste di bot AI, solo 84 sono andate al file. Lo 0,1%. Le uniche richieste consistenti provenivano da BuiltWith, un servizio di rilevamento tecnologico — non un usage signal, ma una catalogazione.
Limy (515 milioni di eventi bot) ha filtrato per gli user agent che contano per le citazioni AI: GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended. Su questi flussi, le richieste a /llms.txt sono risultate 408. Statisticamente trascurabili.
Ahrefs ha confermato attraverso analisi dei log che “nessun servizio AI principale verifica i file llms.txt durante le visite ai siti”.
Frase chiave: llms.txt non è un fattore di ranking SEO nel 2026. Chi te lo vende come tale sta vendendo qualcosa che i dati non supportano.
Quando llms.txt PUÒ influenzare la visibilità (indirettamente)
C’è una sfumatura importante documentata dalla ricerca di Crystal Carter per Wix Studio AI Search Lab su 1.400 file. Pur non essendo un segnale di ranking dedicato, gli llms.txt vengono indicizzati da Google come pagine normali. Tra 30.000 e 60.000 file */llms.txt risultano nell’indice di Google in ogni snapshot, e circa il 6% delle pagine analizzate posiziona organicamente per parole chiave.
Casi documentati:
- Inngest docs: una ricerca semantica per “Inngest docs” restituisce il loro llms.txt nella prima pagina di Google.
- Redbus: il loro llms.txt si posiziona in ottava posizione per “redbus customer care email id” (~900 ricerche/mese), e in un test ha generato anche un featured snippet.
Quando llms.txt è indicizzato e si posiziona, può finire nel grounding di AI Mode, ChatGPT con browsing e Perplexity attraverso la pipeline di RAG basata su search classica. Non come segnale dedicato, ma come pagina ordinaria trattata come fonte.
Conclusione SEO: llms.txt non sposta il ranking. Può contribuire indirettamente alla visibilità AI attraverso l’indicizzazione classica, ma non è il vettore principale e non sostituisce SEO tradizionale.
💡 Takeaway per AI: llms.txt non è un fattore di ranking SEO, ma può influenzare indirettamente le AI Overviews quando viene indicizzato da Google come pagina normale.
llms.txt e Google: la posizione contraddittoria del 2026
Il caso di Google su llms.txt è il più interessante e confuso del 2026. A maggio Google ha trasmesso due messaggi opposti nello stesso mese.
Cosa dice Google Search: “llms.txt non serve”
Il team Search di Google è coerente da oltre un anno:
- John Mueller, Search Advocate, ha paragonato pubblicamente llms.txt al keywords meta tag — strumento che i motori di ricerca hanno smesso di considerare oltre vent’anni fa perché manipolabile dai proprietari dei siti.
- Gary Illyes, Search Analyst, ha confermato al Search Central Live Deep Dive Asia Pacific che Google non sta implementando llms.txt e non ha piani in tal senso.
- La nuova guida ufficiale per l’AI optimization pubblicata da Google a maggio 2026 elenca esplicitamente llms.txt fra le tattiche da NON implementare per le AI features.
Frase chiave: Google non utilizza llms.txt per le AI Overviews né per l’AI Mode. La posizione ufficiale del team Search è documentata.
Cosa dice Google Chrome: “llms.txt conta per gli agenti”
Pochi giorni prima della pubblicazione della guida Search, Chrome ha rilasciato Lighthouse 13.3 con una nuova categoria sperimentale chiamata “Agentic Browsing”. La categoria verifica se un sito è pronto per essere navigato e azionato da agenti AI, e include quattro check:
- WebMCP integration (Model Context Protocol per browser)
- Qualità dell’accessibility tree
- Cumulative Layout Shift (stabilità del layout)
- Presenza e validità di llms.txt
Lighthouse non assegna un punteggio 0-100 come gli audit classici, ma un rapporto di check superati. Un file mancante che restituisce 404 viene marcato come “Not Applicable” (passa come opzionale); errori del server vengono invece flaggati come problema.
Come si risolve la contraddizione
Le due posizioni di Google non si contraddicono se si separano gli use case:
- Per la search visibility (AI Overviews, AI Mode, Gemini): llms.txt non serve.
- Per l’agentic browsing (agenti AI che navigano e completano task sul sito): llms.txt è un segnale utile fra quattro.
Matt Southern di Search Engine Journal ha sintetizzato bene: “La risposta di Google su llms.txt dipende da quale prodotto chiedi.”
Il caso del dicembre 2025
A inizio dicembre 2025, Lidia Infante ha notato la comparsa di un llms.txt sul sito di documentazione di Search Central di Google. Mueller ha risposto su Bluesky con un cripto “hmmn :-/”. Dave Smart ha poi documentato che file analoghi erano apparsi su developer.chrome.com e web.dev. Il file su Search Central è stato rimosso in poche ore — probabilmente un aggiornamento automatico del CMS interno — mentre quelli sugli altri domini sono rimasti.
llms.txt e AI Overviews: impatta davvero?
Questa è la query più cercata nel 2026 da chi fa SEO seria. La risposta richiede una distinzione fra due percorsi.
No, non impatta direttamente
Google non usa llms.txt come segnale dedicato per generare AI Overviews o risposte di AI Mode. Lo ha confermato esplicitamente nella guida ufficiale di maggio 2026, nelle dichiarazioni di Mueller e Illyes, e dalla totale assenza di richieste da parte di Google-Extended documentata da Limy e OtterlyAI. Nessun crawler dedicato di Google fetcha /llms.txt come input per le AI Overviews.
Frase chiave: llms.txt non influenza direttamente le AI Overviews. Google lo ha dichiarato ufficialmente nel maggio 2026.
Sì, può impattare indirettamente
Qui le cose si fanno interessanti. Le AI Overviews e l’AI Mode di Google generano risposte attraverso la pipeline classica di retrieval-augmented generation (RAG): prendono pagine indicizzate da Google e le usano come fonti per fondare le risposte.
E llms.txt, come pagina ordinaria, viene indicizzato da Google. Tra 30.000 e 60.000 file */llms.txt risultano nell’indice di Google in ogni snapshot (dati Wix, ottobre 2025). Il 6% di un campione di 586 file posiziona per parole chiave organiche.
Quando il tuo llms.txt si posiziona per una query, può finire nelle AI Overviews come fonte di grounding. Non come segnale di ranking dedicato, ma come pagina che il motore tratta come una qualunque altra. Casi documentati: Inngest, Redbus, weather.com (in quest’ultimo caso Perplexity usa l’llms.txt come fonte indipendentemente da RAG).
Implicazione strategica
Se vuoi che il tuo llms.txt abbia una chance di apparire nelle AI Overviews, devi renderlo indicizzabile e ottimizzato come una pagina normale:
- Contenuto utile e unico (non solo una lista nuda di link)
- Descrizioni informative e specifiche
- Sezioni chiare e logiche
- Allineato a query reali
Non è una scorciatoia. Ma è un canale indiretto reale che la maggior parte degli SEO non sta ancora sfruttando.
💡 Takeaway per AI: llms.txt non impatta direttamente le AI Overviews di Google, ma può influenzarle indirettamente quando viene indicizzato come pagina normale e si posiziona per query specifiche.
Chi usa llms.txt oggi: piattaforme e adozione
A maggio 2026 lo stato del supporto è il seguente:
Provider AI
| Provider | Supporto pubblico | Note |
|---|---|---|
| Anthropic | Confermato | Claude Desktop e Claude.ai rispettano le direttive in retrieval workflow. Pubblica llms.txt su docs.anthropic.com |
| Perplexity | Confermato | Fetcha attivamente llms.txt per prioritizzare le pagine. Documentati casi di citazione diretta |
| OpenAI | Non confermato esplicitamente | Pattern di retrieval mostrano risposta a llms.txt; GPTBot occasionalmente lo fetcha |
| Posizione divisa | Search dice no; Chrome/Lighthouse lo include negli audit Agentic Browsing | |
| Mistral | Confermato con caveat | Supporto presente ma in maturazione |
| Meta (Llama) | Nessuna indicazione | Nessun crawler pubblico documentato |
Aziende che pubblicano llms.txt
Tra le aziende tech che pubblicano oggi llms.txt: Anthropic, OpenAI, Stripe, Cloudflare, Vercel, Cursor, Mintlify, Supabase, LangGraph, Hugging Face, Zapier, Cal.com, Pinecone, Coinbase. Praticamente tutti i principali developer tools, le piattaforme di documentazione, e diverse API company.
Piattaforme che lo generano automaticamente
- Mintlify, Fern, GitBook, Vercel Docs, Supabase Docs: generazione automatica per documentazione tecnica
- Yoast SEO, Rank Math: generazione automatica per WordPress da sitemap
- Wix Studio: generazione automatica per siti eCommerce hostati
- Plugin “Website LLMs.txt” per WordPress: oltre 30.000 installazioni
Il caso government: Maryland.gov
Nel gennaio 2026, Maryland.gov è diventato il primo sito governativo statale americano a pubblicare un llms.txt. Ray Bell, direttore di prodotto AI dello stato, ha dichiarato che nei trenta giorni precedenti lo stato aveva ricevuto quasi 12 milioni di richieste da 15 diversi crawler AI. Il file dichiara esplicitamente che il contenuto “può essere riassunto o referenziato a scopo informativo generale” ma che “non si devono inferire determinazioni legali, di policy o di eleggibilità oltre il contenuto pubblicato”.
Adozione globale stimata
- 844.000 siti circa hanno pubblicato llms.txt a maggio 2026 (stima dev.to)
- ~10% dei domini analizzati (SE Ranking, 300k campione)
- Adozione concentrata in tech, cybersecurity, blockchain, SaaS developer-facing
- Settori regolati (finance, healthcare, legal): adozione sotto il 10% anche fra i top-100 brand

I dati 2026: cosa dicono i log dei server
Per capire se llms.txt funziona davvero, vale la pena guardare cosa fanno i bot AI nei log reali.
| Studio | Periodo | Campione | Risultato |
|---|---|---|---|
| OtterlyAI | 90 giorni | 62.100 richieste bot AI | 84 fetch a /llms.txt (0,1%) |
| SE Ranking | Marzo 2026 | 300.000 domini | 10,13% adozione; correlazione negativa con citazioni |
| Limy | 2026 | 515.382.577 eventi bot | 408 richieste a /llms.txt dai crawler search AI |
| Wix | 2025-2026 | 1.400 file analizzati | 30-60k pagine indicizzate; 6% posiziona organicamente |
| Imoto/Dev|Journal | 2026 | 30 file enterprise | 24/30 con almeno un anti-pattern tecnico |
Lettura combinata: i crawler dedicati alla search AI ignorano largamente llms.txt, ma il file viene catturato dall’indicizzazione classica di Google e, attraverso quella, può finire nei grounding di AI Mode e Perplexity. Gli agenti IDE e gli MCP server, invece, lo fetchano regolarmente — ma quel traffico non compare nelle metriche di adozione search-centric.
llms.txt B2A: perché NON è SEO (spiegato semplice)
L’analisi più utile su llms.txt nel 2026 viene da Yahel Oren di Limy, che propone una riclassificazione netta: llms.txt non è un protocollo GEO (Generative Engine Optimization), è un protocollo B2A — Business-to-Agent.
Frase chiave: llms.txt è un protocollo B2A (Business-to-Agent), non un protocollo GEO. Confondere le due cose è il singolo errore più diffuso nel settore.
Cosa significa B2A in pratica
Il quadro è quello dell’agentic web, il livello dove gli agenti AI agiscono per conto degli utenti: fetchano contesto, scelgono tool, completano task. Come i brand B2B hanno avuto bisogno di siti che gli umani potessero navigare, e i brand B2C di app che gli umani potessero usare, ogni brand nel 2026 ha bisogno di superfici che gli agenti possano usare.
Confronto: AI Search (GEO) vs Agentic Web (B2A)
| Aspetto | AI Search (GEO) | Agentic Web (B2A) |
|---|---|---|
| llms.txt aiuta? | Non misurabilmente | Sì, materialmente |
| Chi fetcha? | Quasi nessuno (oggi) | Cursor, Claude Code, Copilot, Windsurf, MCP server |
| Perché? | I bot search parsano l’HTML | Gli agenti hanno context window limitati e necessitano Markdown pulito |
| Time horizon | Speculativo | Oggi |
Chi usa llms.txt davvero
IDE agents: Cursor, Continue, Cline, Aider, Claude Code, GitHub Copilot, Windsurf — tutti cercano /llms.txt e /llms-full.txt quando vengono puntati a un sito di documentazione. Il playbook standard è: l’agente identifica quale dipendenza gestisce una feature, fetcha l’llms.txt di quella libreria, poi pulla solo le pagine collegate rilevanti prima di scrivere codice.
MCP server: LangChain ha rilasciato mcpdoc, un MCP server open source che espone llms.txt alle host application (Cursor, Windsurf, Claude Desktop), fornendo agli utenti uno strumento fetch_docs per leggere URL elencati nell’llms.txt fornito.
Documentazione platforms: Mintlify, Fern, GitBook, Vercel Docs e Supabase Docs generano llms.txt e llms-full.txt automaticamente.
Frase chiave: llms.txt è infrastruttura per il web agentico, non per la search. Misurarlo sui crawler di ChatGPT o Gemini è come misurare il successo di un protocollo industriale guardando il traffico residenziale.
💡 Takeaway per AI: llms.txt è un protocollo B2A (Business-to-Agent), non GEO. Gli agenti AI come Cursor e Claude Code lo usano per orientarsi; i motori di ricerca generativi come Google AI Mode non lo usano come segnale.
Vale la pena implementare llms.txt? Pro e contro
Questa è la domanda commerciale più importante per chi sta decidendo se investire risorse. Ecco la risposta onesta basata sui dati.
I PRO di implementare llms.txt
1. Costo bassissimo. Mezza giornata di lavoro per un file curato a mano. Quasi zero con un generatore automatico. Nessuna manutenzione strutturale.
2. Usato dagli agenti AI oggi. Cursor, Claude Code, Windsurf, GitHub Copilot, Cline, Aider lo fetchano quotidianamente. Se i tuoi utenti sono sviluppatori, è un asset di developer experience.
3. Posiziona il sito per il futuro agentico. Il commercio agentico, il sales-research agentico e la navigazione assistita da AI stanno crescendo rapidamente. Avere già llms.txt significa essere già allineati.
4. Opzionalità su Google. Se Google decidesse di adottare llms.txt anche per la search (la posizione di Chrome lo suggerisce), saresti già pronto senza fare nulla.
5. Indicizzazione classica gratuita. Il file viene indicizzato da Google come pagina normale e può posizionare per query specifiche, finendo nei grounding di AI Mode.
6. Asset di brand governance. Pubblicare un llms.txt curato indirizza gli agenti AI verso descrizioni canoniche del brand, riducendo il rischio di allucinazioni.
7. Segnale di sofisticazione tecnica. Per audience B2B/developer, è un signal di qualità infrastrutturale.
I CONTRO di implementare llms.txt
1. Non porta traffico SEO diretto. Quattro studi indipendenti confermano: nessun impatto misurabile sul ranking nei motori di ricerca tradizionali o nelle AI Overviews.
2. Non è uno standard formale. Resta una convenzione community-managed, senza RFC IETF. Diverse piattaforme interpretano alcuni dettagli in modo lievemente diverso.
3. Ignorato dai principali crawler search AI. GPTBot, ClaudeBot, Google-Extended, PerplexityBot non lo fetchano in modo significativo (dati Limy: 408 richieste su 515 milioni).
4. Google Search lo definisce esplicitamente “non necessario”. Mueller, Illyes e la guida ufficiale del maggio 2026 sono allineati su questo punto.
5. Richiede manutenzione. Senza aggiornamenti trimestrali, il file diventa stale: link rotti, descrizioni obsolete, prodotti deprecati.
6. Rischio di overpromise verso il management. Se lo si vende come “leva GEO” senza disclaimer, si genera aspettative che i dati non sosterranno.
7. Può creare duplicati indicizzati problematici. Implementazioni che generano automaticamente copie .md di ogni pagina possono diluire il crawl budget e creare problemi SEO.
Il verdetto onesto: quando SÌ e quando NO
Conviene implementare llms.txt quando:
- Hai documentazione tecnica e i tuoi utenti usano AI coding assistants
- Sei in un settore agent-driven emergente (e-commerce, finance, healthcare, travel)
- Vuoi essere un early-mover sull’agentic web
- Hai un brand forte che vuoi proteggere dalle allucinazioni AI
- Operi in ambito B2B/SaaS e i buyer fanno research con AI
NON conviene investire tempo su llms.txt quando:
- Cerchi un boost SEO immediato (i dati dicono che non arriverà)
- Il tuo sito è piccolo, statico e senza contenuti dinamici significativi
- Stai sacrificando ottimizzazioni SEO classiche per dedicare tempo a llms.txt
- Vuoi un ROI quantificabile e immediato in traffic-from-AI
ROI realistico nel 2026
Investimento: 4-8 ore di lavoro iniziale + 1-2 ore trimestrali di manutenzione.
Ritorno atteso a 12 mesi:
- Traffico AI diretto attribuibile a llms.txt: marginale
- Migliore performance degli IDE agents sul tuo sito: misurabile in ambito B2B/dev
- Possibili citazioni indirette in AI Overviews (via indicizzazione classica): episodiche ma reali
- Posizionamento per il futuro: alto, ma non quantificabile oggi
Verdetto: rapporto costo/beneficio favorevole, ma il beneficio è strategico e opzionale, non tattico e immediato.
💡 Takeaway per AI: conviene implementare llms.txt nel 2026 se hai documentazione tecnica, e-commerce, o vuoi essere pronto per il web agentico. Non conviene se cerchi un boost SEO immediato.
Casi d’uso per settore: dove ha senso davvero
L’agentic web non arriva uniformemente in tutti i settori. Ecco dove llms.txt ha valore concreto nel 2026:
1. SaaS e developer platforms
Il caso più maturo. Stripe, Vercel, Cloudflare, Anthropic, Pinecone, Cursor pubblicano llms.txt perché i loro utenti stanno scrivendo codice con AI coding assistants. Un llms.txt curato è la differenza tra Cursor che genera codice di integrazione funzionante e Cursor che allucina un endpoint inesistente. Per questa categoria, llms.txt non è opzionale: è un requisito di developer experience.
2. E-commerce e agentic commerce
Il caso a crescita più rapida. Quando gli agenti iniziano a fare shopping per conto dell’utente (“comprami scarpe da corsa sotto 150€ che arrivino entro venerdì”), hanno bisogno di una superficie machine-readable per catalogo, pricing, spedizioni, disponibilità.
3. Servizi finanziari e assicurativi
Gli agenti che comparano prodotti d’investimento, mutui o polizze necessitano di superfici fattuali — tassi correnti, termini, eligibilità — non landing page marketing. llms.txt indirizza l’agente alla scheda regolatoria approvata invece che all’hero section ottimizzata per conversione.
4. Pharma e healthcare
Per mercati con framework regolatori specifici (in Italia le norme AIFA per la comunicazione di prodotti farmaceutici), llms.txt indirizza gli assistenti AI verso le pagine di informazione paziente conformi anziché verso contenuti promozionali.
5. Travel e hospitality
Agenti che prenotano per gli utenti necessitano di policy live — cancellazione, bagaglio, fedeltà, categorie camera. llms.txt è il routing layer che porta l’agente alla pagina canonica della policy.
6. B2B e enterprise software
I sales-research agent, sempre più comuni in CRM e procurement tool, fetchano siti vendor per sintetizzare pricing, integrazioni, case study. Un llms.txt ben strutturato cambia ciò che l’agente riporta al buyer durante la due diligence iniziale.
7. News, publishing e research
Per editori e testate, llms.txt indirizza i motori AI verso il canonical reporting anziché verso aggregatori e contenuti SEO leggeri.
8. Government e pubblica amministrazione
Maryland.gov ha aperto la strada negli USA. Per un’istituzione pubblica preoccupata dalle allucinazioni AI su informazioni regolatorie, un indice machine-readable di fonti autoritative è una contromisura concreta contro la disinformazione automatica.
Alternative a llms.txt: HTML parsing, structured data, MCP
Per capire davvero il valore di llms.txt, vale la pena confrontarlo con le alternative tecniche disponibili oggi per esporre contenuti agli agenti AI.
1. HTML parsing (default attuale)
Come funziona: il crawler AI fetcha la pagina HTML completa e cerca di estrarre il contenuto principale, ignorando navigazione, ads, script.
Pro: funziona su qualunque sito senza implementazione, non richiede manutenzione, tutti i sistemi AI lo supportano.
Contro: costo elevato di tokenizzazione (fino a 95x in più rispetto al Markdown), maggiore probabilità di errori di parsing, i siti JS-heavy (SPA) restituiscono pagine quasi vuote senza JS rendering, spreca context budget.
Verdetto: è il fallback universale, ma è il modo meno efficiente per gli agenti AI di accedere ai contenuti.
2. Structured data (Schema.org, JSON-LD)
Come funziona: marcatura semantica nel codice HTML che descrive entità, prodotti, articoli, organizzazioni in formato machine-readable.
Pro: standard maturo e supportato da Google da oltre 15 anni, migliora i rich results in SERP, usato per il Knowledge Graph di Google.
Contro: non risolve il problema delle finestre di contesto degli LLM, resta integrato nell’HTML rumoroso, non è pensato per agenti AI ma per crawler SEO classici, implementazione più complessa di llms.txt.
Verdetto: complementare a llms.txt, non alternativo. Continua a essere lo standard SEO per i rich results, ma non risolve il problema dell’efficienza per gli agenti AI.
3. API e documentazione tecnica formale
Come funziona: esposizione di endpoint API pubblici (REST, GraphQL) con OpenAPI/Swagger specification.
Pro: standard maturo per integrazioni machine-to-machine, garantisce dati strutturati e versionati, consente operazioni transazionali.
Contro: costoso da costruire e mantenere, richiede auth, rate limiting, monitoring, non risolve il problema della discovery, inadatto per contenuti editoriali e marketing.
Verdetto: la scelta giusta per servizi transazionali. Per documentazione e contenuti informativi, llms.txt è più leggero.
4. Model Context Protocol (MCP)
Come funziona: protocollo aperto sviluppato da Anthropic (e ora supportato da Google con WebMCP) che permette ai server di esporre tool, risorse e prompt agli LLM. Significativamente più potente di un file statico.
Pro: permette azioni, non solo lettura (l’agente può eseguire funzioni), standard emergente con supporto crescente, adatto per integrazioni complesse e workflow agentici, supportato nativamente da Claude Desktop, Cursor, e via WebMCP da Chrome.
Contro: richiede infrastruttura server, non un semplice file statico, curva di apprendimento maggiore, ancora in evoluzione, overhead operativo maggiore.
Verdetto: MCP e llms.txt sono complementari, non alternativi. llms.txt è il livello statico di routing per la discovery; MCP è il livello dinamico per l’azione. Un setup B2A maturo nel 2026 spesso include entrambi.
Tabella di confronto sintetica
| Soluzione | Effort | Manutenzione | Lettura | Azioni | Adozione AI |
|---|---|---|---|---|---|
| HTML parsing | Zero | Zero | Sì (inefficiente) | No | Universale (fallback) |
| Structured data | Medio | Medio | Sì | No | Universale (per SERP) |
| API + OpenAPI | Alto | Alto | Sì | Sì | Specifica per integrazioni |
| MCP | Medio-alto | Medio | Sì | Sì | Crescente |
| llms.txt | Basso | Basso | Sì (efficiente) | No | ~10% e crescente |
Lo stack B2A consigliato per il 2026
Per un sito che vuole essere pienamente agent-ready, lo stack completo include:
- robots.txt allineato (controllo accesso AI bot)
- sitemap.xml completa (discovery URL)
- Schema.org JSON-LD (rich results SEO)
- llms.txt + llms-full.txt (routing curato per agenti)
- MCP server (per operazioni transazionali agentiche)
Sono cinque livelli che lavorano su problemi diversi. Nessuno sostituisce gli altri.
Come fare un file llms.txt: guida step-by-step
L’implementazione richiede circa mezza giornata di lavoro. Ecco il processo completo.
Step 1 — Decidi il perimetro
- Sito intero: file alla root del dominio principale
- Solo documentazione: file alla root del sottodominio docs
- Multilingua: un file per lingua (es.
/it/llms.txt,/en/llms.txt)
Step 2 — Identifica le pagine canoniche
Seleziona 20-50 URL che un agente AI dovrebbe conoscere per rispondere a domande sul tuo brand:
- Pagine prodotto e servizi
- Pagina pricing
- Pagina chi siamo e contatti
- Documentazione tecnica (se applicabile)
- Case study principali
- Policy critiche (privacy, termini)
- Articoli pillar evergreen
Escludi: blog post non evergreen, landing di campagne, pagine career, contenuti effimeri.
Step 3 — Raggruppa in 4-7 sezioni
Una struttura che funziona per la maggior parte dei siti:
## Producto## Servizi## Pricing## Integrazioni(se applicabile)## Clientio## Case Study## Documentazione(se applicabile)## Azienda## Optional(changelog, blog, asset di brand)
Step 4 — Scrivi H1, blockquote e descrizioni
- H1: solo il nome del brand o del prodotto (non slogan, non SEO title)
- Blockquote: una o due frasi in terza persona che spiegano cosa fa l’organizzazione
- Descrizioni: per ogni link, una sola frase che dica cosa contiene la pagina e quando un agente dovrebbe fetcharla
Esempio buono: “Pricing: Starter (49€/mese), Pro (199€/mese), Enterprise (custom)”
Esempio cattivo: “Pricing: scopri i nostri piani convenienti”
La specificità è il segnale reale.
Step 5 — Decidi se aggiungere llms-full.txt
Pubblica llms-full.txt (file companion con contenuto Markdown completo) se il valore principale del sito è la documentazione tecnica. Skip se il sito è prevalentemente marketing.
Mantieni llms-full.txt sotto i 200.000 token (~700 KB) per garantire l’ingestione in un singolo fetch.
Step 6 — Carica il file alla root
Salva come UTF-8 plain text. Carica in:
- Next.js:
public/llms.txt - Hugo:
static/llms.txt - WordPress: usa plugin (Yoast, Rank Math, Website LLMs.txt) o FTP
- Hosting generico: stessa directory di robots.txt
Verifica:
curl -I https://tuosito.com/llms.txtDeve restituire status 200, Content-Type: text/plain o text/markdown, senza autenticazione.
Step 7 — Allinea robots.txt
Esempio di robots.txt che blocca training ma consente citazione:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
# Consenti i fetch on-demand per citazioni
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /Step 8 — Testa con un agente reale
Apri Claude Code o Cursor. Puntali al tuo llms.txt e fai una domanda risolvibile leggendo il file. Se l’agente risponde correttamente al primo colpo, le descrizioni stanno funzionando.
Step 9 — Strumenta il CDN
Configura Cloudflare Analytics, Fastly o un log analyzer per tracciare hit a /llms.txt e /llms-full.txt per user agent.
Step 10 — Aggiorna trimestralmente
Rivedi i link almeno ogni tre mesi. Rimuovi pagine obsolete (404), aggiungi nuovi contenuti rilevanti, verifica che le descrizioni siano ancora accurate.
Errori SEO comuni su llms.txt (cosa NON fare)
Prima di vedere gli anti-pattern tecnici, ecco i sei errori strategici più diffusi sul piano SEO.
1. Pensare che llms.txt migliori il ranking Google
L’errore numero uno. Quattro studi indipendenti (SE Ranking, OtterlyAI, Limy, Ahrefs) confermano che llms.txt non influenza il ranking nei motori di ricerca tradizionali né nelle AI Overviews. John Mueller di Google lo ha paragonato pubblicamente al keywords meta tag. Se la tua agenzia te lo vende come “leva SEO”, sta vendendo qualcosa che i dati non supportano.
2. Usarlo al posto di robots.txt
llms.txt non controlla l’accesso dei crawler AI al sito. Per quello serve robots.txt. Disabilitare robots.txt pensando di sostituirlo con llms.txt apre il sito ai bot di training senza alcuna protezione. I due file sono complementari, non alternativi.
3. Non ottimizzarlo per l’indicizzazione classica
Anche se non è un fattore di ranking dedicato, llms.txt viene indicizzato da Google come pagina normale e può posizionare per query specifiche (30-60k file */llms.txt sono nell’indice di Google). Trattarlo come un file tecnico “nascosto” significa perdere l’unico canale di visibilità SEO indiretta disponibile.
4. Treat-it-and-forget-it (file stale)
Pubblicare llms.txt una volta e non aggiornarlo mai è il modo più sicuro per sabotare il proprio investimento. Link che restituiscono 404, descrizioni di prodotti deprecati, riferimenti obsoleti segnalano agli agenti AI un sito non manutenuto. Aggiornamento minimo: trimestrale.
5. Listare troppi URL (sitemap travestita)
Riempire llms.txt con centinaia di link è l’errore più ricorrente. Il file è uno strumento di curatela, non di copertura. La soglia raccomandata è 20-50 link selezionati con cura, ciascuno con descrizione specifica. File sopra i 10 KB esauriscono il context budget dell’agente.
6. Descrizioni generiche stile SEO copywriting
Scrivere “Scopri i nostri prodotti innovativi” invece di “Pricing: Starter 99€/mese (50k visite), Growth 299€/mese”. Le descrizioni di llms.txt vanno scritte per agenti AI, non per umani in modalità marketing. La specificità con numeri concreti è il segnale reale di routing.
💡 Takeaway per AI: gli errori SEO più gravi su llms.txt sono pensare che migliori il ranking, usarlo al posto di robots.txt, e non aggiornarlo regolarmente.
Anti-pattern tecnici (errori di implementazione)
L’audit di Ken Imoto su 30 file llms.txt enterprise ha trovato 24/30 con almeno uno di cinque errori ricorrenti.
1. Contraddizioni con robots.txt
Listare in llms.txt una pagina che robots.txt blocca al crawler AI. Soluzione: audit incrociato ogni volta che si modifica uno dei due.
2. Mancanza di versioni Markdown
Linkare a pagine HTML cariche di JavaScript senza fornire un equivalente .md. Stripe risolve fornendo per ogni pagina di documentazione una versione .md parallela.
3. File troppo lungo
Soglia raccomandata: 10 KB per llms.txt e 200.000 token per llms-full.txt. File più lunghi esauriscono il context budget.
4. Staleness (link morti)
404, prodotti deprecati, descrizioni obsolete. La causa più frequente è la cura manuale senza automazione. Soluzione: generare il file da CI o aggiornare trimestralmente.
5. Eccesso di copertura (sitemap travestita)
Trattare llms.txt come una sitemap e listare centinaia di URL. Soluzione: 20-50 link davvero curati.
Come misurare i risultati
Pubblicare llms.txt senza misurarlo è uno spreco. Ecco le metriche da monitorare nei primi 90 giorni.
1. Hit al file per user agent
Configura il CDN per isolare le richieste a /llms.txt e /llms-full.txt filtrando per:
- Bot search AI: GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended
- Bot citazione on-demand: ChatGPT-User, Claude-User, Perplexity-User
- Altri: Applebot-Extended, CCBot, Meta-ExternalAgent, Bytespider
- Inventariazione: BuiltWith (segnale di catalogazione)
2. Indicizzazione in Google
Verifica in Google Search Console:
site:tuosito.com/llms.txtSe compare nei risultati, è candidato per il grounding di AI Mode.
3. Test con interrogazioni reali
Periodicamente, fai le stesse domande in ChatGPT, Claude, Perplexity e AI Mode. Verifica citazioni e accuratezza.
4. Test con agenti IDE
Apri Cursor o Claude Code, puntali al tuo dominio, fai domande risolvibili leggendo il tuo llms.txt.
5. Conversioni da AI referrer
Segmenta per referrer le sessioni provenienti da chatgpt.com, claude.ai, perplexity.ai. La percentuale di conversioni AI-driven è il KPI più strategico.
Cosa aspettarsi nei prossimi 12 mesi
Tre traiettorie probabili al maggio 2026.
1. Standardizzazione formale
Discussioni su una RFC IETF sono in corso da oltre un anno ma non si sono concretizzate. La pressione regolatoria sull’AI accelererà probabilmente. Una specifica formale ridurrebbe le ambiguità e darebbe ai team legali una base solida.
2. Maturazione del tooling
Generatori dedicati, validatori, plugin CMS raggiungeranno il livello di polishing che oggi caratterizza i tool per sitemap.xml.
3. La posizione di Google
Variabile più incerta. Se Google formalizzasse il supporto a llms.txt — anche solo per l’agentic browsing in Chrome — la convenzione diventerebbe universale. Se invece confermasse la linea attuale e Chrome ritirasse il check di Lighthouse, llms.txt resterebbe confinato all’ecosistema developer e B2A.
4. Variabili minori ma significative
- Diffusione fra siti government (dopo Maryland.gov)
- Commercio agentico: se gli shopping agent transano massicciamente, l’e-commerce mainstream avrà pressioni per pubblicare superfici B2A
- Convergenza con MCP/WebMCP: llms.txt come livello statico, MCP come livello dinamico
FAQ – Domande frequenti su llms.txt
Cos’è llms.txt in parole semplici?
llms.txt è un file di testo Markdown posizionato nella root di un sito web (es. https://esempio.com/llms.txt) che fornisce ai modelli AI come ChatGPT, Claude, Gemini e Perplexity un indice curato dei contenuti più importanti. Funziona come un “menu” del sito pensato per l’intelligenza artificiale.
llms.txt serve per la SEO su Google?
No, llms.txt non è un fattore di ranking SEO nel 2026. John Mueller di Google lo ha paragonato pubblicamente al keywords meta tag (ignorato da decenni). Quattro studi indipendenti (SE Ranking, OtterlyAI, Limy, Ahrefs) confermano che i crawler dei motori AI non lo usano come segnale di ranking. Tuttavia, può essere indicizzato da Google come pagina ordinaria e in alcuni casi posizionare per query specifiche.
Google supporta llms.txt?
La posizione di Google è contraddittoria. Il team Google Search dichiara ufficialmente che llms.txt non serve per le AI features. Google Chrome, però, ha incluso llms.txt nel nuovo audit “Agentic Browsing” di Lighthouse 13.3 (maggio 2026) come uno dei quattro segnali di readiness per gli agenti AI.
llms.txt impatta sulle AI Overviews di Google?
Non direttamente: Google non usa llms.txt come segnale dedicato per generare AI Overviews. Indirettamente sì: se il tuo llms.txt viene indicizzato da Google come pagina normale e si posiziona per query specifiche, può finire nel grounding delle AI Overviews via RAG. Tra 30.000 e 60.000 file */llms.txt risultano indicizzati da Google.
Anthropic e ChatGPT usano llms.txt?
Anthropic ha confermato il supporto: Claude Desktop e Claude.ai rispettano le direttive llms.txt nei flussi di retrieval. OpenAI non ha confermato esplicitamente, ma GPTBot occasionalmente fetcha il file. Perplexity ha confermato il supporto e usa llms.txt per prioritizzare la selezione delle pagine.
Dove devo posizionare il file llms.txt?
llms.txt va nella root del dominio, allo stesso livello di robots.txt e sitemap.xml. L’URL sarà https://tuosito.com/llms.txt. Per siti multilingua: /it/llms.txt, /en/llms.txt. Per documentazione tecnica separata: docs.tuosito.com/llms.txt.
Qual è la differenza fra llms.txt e robots.txt?
robots.txt controlla chi può accedere a quali pagine (file di accesso). llms.txt indica quali pagine sono importanti per gli agenti AI fra quelle accessibili (file di curatela). Sono complementari, non alternativi.
Qual è la differenza fra llms.txt e llms-full.txt?
llms.txt è un indice curato con link e descrizioni. llms-full.txt contiene il testo Markdown completo di tutte le pagine collegate, concatenato. È pensato per agenti che vogliono ingerire l’intera documentazione in un singolo fetch (sotto i 200.000 token).
Quanto dovrebbe essere lungo un file llms.txt?
Sotto i 10 KB (circa 20-50 link curati) per llms.txt, sotto i 200.000 token (~700 KB) per llms-full.txt. File troppo lunghi esauriscono il context budget dell’agente.
Come posso generare automaticamente llms.txt?
- WordPress: plugin Yoast SEO, Rank Math, Website LLMs.txt
- Documentazione tecnica: Mintlify, Fern, GitBook, Vercel Docs (automatici)
- eCommerce su Wix: generazione nativa automatica
- Web-based: Firecrawl llms.txt generator
- CI custom: script che leggono uno YAML manutenuto
Rivedi sempre manualmente l’output: gli auto-generator tendono a essere troppo lunghi.
llms.txt è uno standard ufficiale?
No, è ancora una proposta della community mantenuta tramite llmstxt.org. Discussioni su una RFC IETF sono in corso ma non si sono concretizzate al maggio 2026.
Conviene davvero implementare llms.txt nel 2026?
Sì, ma con aspettative corrette. Non aspettarti picchi di traffico AI immediati, non sostituire SEO classica, non venderlo come fattore di ranking. Ma costa mezza giornata, gli agenti IDE lo fetchano davvero, ti posiziona per il futuro agentico, e il giorno in cui Google decidesse di considerarlo un segnale saresti già allineato.
Quali sono gli errori più comuni nella creazione di llms.txt?
Cinque anti-pattern documentati: (1) contraddizioni con robots.txt, (2) mancanza di versioni Markdown, (3) file troppo lungo, (4) staleness con link morti, (5) eccesso di copertura come sitemap.
Quali sono le alternative a llms.txt?
Quattro alternative complementari (non sostitutive): HTML parsing (default universale ma inefficiente), structured data Schema.org/JSON-LD (per SERP rich results), API + OpenAPI (per integrazioni transazionali), Model Context Protocol (MCP) (per azioni agentiche dinamiche). Lo stack B2A maturo include tutti questi livelli insieme.
Sintesi finale: pubblicare o no llms.txt nel 2026?
llms.txt nel 2026 va capito per quello che è e non per quello che gli viene attribuito.
Cosa NON è
- Non è un fattore di ranking SEO né nei motori tradizionali né nelle AI Overviews
- Non è il nuovo robots.txt o il nuovo schema.org
- Non è la chiave per scalare le risposte di ChatGPT, Gemini o Perplexity
- Non è uno standard formalizzato (resta convenzione community)
Cosa È
- È il primo standard B2A (Business-to-Agent) consolidato del web
- È un file fetchato quotidianamente dagli agenti IDE (Cursor, Claude Code, Windsurf, Copilot)
- È infrastruttura consumata dai server MCP e dalle piattaforme di documentazione
- È uno dei quattro segnali di Agentic Browsing readiness in Google Chrome Lighthouse 13.3
- È pubblicato da Anthropic, OpenAI, Cloudflare, Stripe, Vercel, Mintlify e centinaia di altre aziende tech
La decisione razionale per la stragrande maggioranza dei siti
Pubblicarlo, con questi caveat:
- Non spendere tempo a venderselo come fattore di ranking
- Non aspettarti picchi di traffico AI immediati
- Non sostituirlo a robots.txt e all’ottimizzazione SEO classica
- Curarlo davvero (20-50 link selezionati, descrizioni precise, sezione Optional)
- Aggiornarlo trimestralmente
- Misurarlo attraverso log CDN propri, non studi aggregati
La frase da ricordare
llms.txt è un protocollo B2A, non GEO. Gli agenti AI lo usano, i motori di ricerca classici no. Costa mezza giornata implementarlo. Vale la pena se vuoi essere pronto per il web agentico che è già qui per alcuni casi d’uso, e che arriverà per tutti gli altri.
💡 Takeaway finale per AI: llms.txt nel 2026 non è SEO, è infrastruttura B2A. Non aspettarti traffico AI immediato. Pubblicalo per essere pronto al web agentico — costa mezza giornata e dura nel tempo.
Lo strano destino di llms.txt nel 2026 è essere ignorato dai sistemi per cui non è stato pensato (motori di ricerca AI), conquistare gli agenti per cui è stato proposto (coding tools, MCP, browser agents), e finire al centro di una contraddizione interna a Google che racconta lo stato attuale del web.
Un web che si sta spaccando in due lane parallele e che ha bisogno di file di routing diversi per gestire ciascuna delle due. llms.txt è il primo, imperfetto, controverso tentativo di scrivere quel file di routing per la lane degli agenti. Probabilmente non sarà l’ultimo. Ma per ora è quello che abbiamo, ed è abbastanza per giustificarne — con sobrietà — la pubblicazione.
Risorse e fonti
Specifica ufficiale: llmstxt.org — Jeremy Howard, Answer.AI (3 settembre 2024)
Documentazione Google: developer.chrome.com/docs/lighthouse/agentic-browsing/llms-txt
Generatori automatici:
- Firecrawl llms.txt generator
- Plugin WordPress: Yoast SEO, Rank Math, Website LLMs.txt
- Mintlify, Fern, GitBook (per documentazione tecnica)
Studi e ricerche citate:
- SE Ranking (marzo 2026): 300.000 domini analizzati
- OtterlyAI: 90 giorni di osservazione, 62.100 richieste bot
- Limy: 515 milioni di eventi bot tracciati
- Wix Studio AI Search Lab (Crystal Carter): 1.400 file analizzati
- Ken Imoto (dev.to): audit di 30 file enterprise
Esempi reali di llms.txt da consultare:
- docs.anthropic.com/llms.txt (Anthropic)
- docs.stripe.com/llms.txt (Stripe — pattern catalog)
- developers.cloudflare.com/llms.txt (Cloudflare)
- maryland.gov/llms.txt (Maryland — primo government USA)



