Ghid tehnic
Cum permiți accesul crawlerelor AI la site-ul tău
Dacă ChatGPT, Claude sau Perplexity nu îți pot citi paginile, nu te pot cita — indiferent cât de bun este conținutul. Iată ce verifici și ce configurezi.
Actualizat la · Echipa BrandScan
Ce crawlere contează și ce face fiecare
Motoarele AI folosesc crawlere diferite pentru scopuri diferite, iar o singură regulă din robots.txt le poate bloca pe toate deodată. Distincția importantă este între crawlerele care adună date pentru antrenare și cele care aduc pagina în momentul în care un utilizator pune o întrebare.
Blocarea unui crawler de antrenare nu îți scoate site-ul din răspunsuri. Blocarea unui crawler de tip retrieval, în schimb, te scoate exact din momentul în care ai fi fost citat.
- · GPTBot — antrenare OpenAI. Blocarea lui nu afectează citările din ChatGPT cu căutare.
- · OAI-SearchBot și ChatGPT-User — aduc pagina în timp real pentru un răspuns. Acestea contează cel mai mult.
- · ClaudeBot și anthropic-ai — Anthropic, antrenare și retrieval.
- · PerplexityBot și Perplexity-User — Perplexity, indexare și acces la cerere.
- · Google-Extended — controlează folosirea conținutului în Gemini și AI Overviews, separat de Googlebot.
- · Googlebot și Bingbot — căutarea clasică, care alimentează și o parte din rezultatele AI.
Greșeala cea mai frecventă: un Disallow prea larg
Cel mai des întâlnit tipar este un grup `User-agent: *` cu reguli scrise pentru a ascunde zone private, care ajung să acopere și pagini publice importante. Regulile din robots.txt se aplică pe prefix, nu pe potrivire exactă: `Disallow: /p` blochează și `/preturi`, și `/produse`, și `/portofoliu`.
A doua greșeală este blocarea resurselor de care depinde randarea. Dacă blochezi `/_next/` sau folderul de scripturi, crawlerele care execută JavaScript primesc o pagină goală, chiar dacă HTML-ul este permis.
# Greșit — blochează /preturi, /produse, /portofoliu
User-agent: *
Disallow: /p
# Corect — cale completă, cu delimitator
User-agent: *
Disallow: /panou-admin/
Disallow: /cos/
Allow: /Configurația recomandată pentru robots.txt
Pentru majoritatea site-urilor comerciale, regula practică este: permite tot ce este public, blochează explicit doar ce nu trebuie indexat, și declară sitemap-ul. Dacă vrei să permiți citarea dar nu antrenarea, separă grupurile pe crawler.
User-agent: *
Allow: /
Disallow: /cont/
Disallow: /cos/
Disallow: /checkout/
# Permite explicit crawlerele care aduc pagina pentru un răspuns
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
Allow: /
Sitemap: https://exemplu.ro/sitemap.xmlLa ce ajută llms.txt
llms.txt este un fișier Markdown la rădăcina site-ului care rezumă ce este organizația și care sunt paginile canonice. Nu este un standard impus de niciun motor și nu înlocuiește robots.txt sau sitemap-ul, dar reduce ambiguitatea atunci când un sistem AI încearcă să înțeleagă rapid ce faci.
Ține-l scurt și factual: un titlu, două-trei propoziții despre entitate, apoi linkuri absolute către paginile importante.
# Exemplu SRL
Companie românească de consultanță tehnică, fondată în 2019, cu sediul în București.
- [Servicii](https://exemplu.ro/servicii)
- [Prețuri](https://exemplu.ro/preturi)
- [Contact](https://exemplu.ro/contact)Cum verifici că funcționează
Verificarea manuală este simplă, dar trebuie făcută pentru fiecare crawler separat, pentru că grupurile din robots.txt nu se combină: un crawler respectă doar grupul cel mai specific care i se potrivește, nu și `User-agent: *`.
- · Deschide `https://domeniul-tau.ro/robots.txt` și citește grupul care se potrivește fiecărui crawler.
- · Confirmă că paginile importante nu cad sub niciun `Disallow` prin potrivire de prefix.
- · Verifică dacă pagina răspunde cu 200 și fără `noindex` în meta sau în antetul `X-Robots-Tag`.
- · Confirmă că sitemap-ul este declarat și că răspunde cu 200.
Întrebări frecvente
Dacă blochez GPTBot, dispar din ChatGPT?
Nu. GPTBot adună date pentru antrenare. Citările din ChatGPT cu căutare vin prin OAI-SearchBot și ChatGPT-User, care sunt crawlere separate. Dacă vrei să apari în răspunsuri fără să contribui la antrenare, blochează GPTBot și permite explicit celelalte două.
Trebuie neapărat să am llms.txt?
Nu este obligatoriu și niciun motor nu îl cere. Ajută la dezambiguizare, mai ales dacă numele brandului seamănă cu al altcuiva, dar nu compensează un robots.txt greșit sau lipsa unui sitemap.
Cât durează până se vede efectul unei modificări în robots.txt?
Crawlerele recitesc robots.txt de obicei în câteva ore până la câteva zile. Pentru crawlerele care aduc pagina la cerere, efectul este aproape imediat, pentru că accesează site-ul în momentul întrebării.
Un crawl-delay mare este o problemă?
Poate fi. Un `Crawl-delay` de câteva secunde limitează sever numărul de pagini care pot fi parcurse într-o sesiune, așa că paginile din adâncimea site-ului pot rămâne nevăzute. Folosește-l doar dacă serverul chiar are nevoie de protecție.
Verifică-ți site-ul acum
Rulează gratuit verificările din acest ghid pe propriul site.