AI tarayıcılarını tek bir düğmeyle değil, bot bot yönetirsiniz. En işe yarar hamle GPTBot'u kapatıp OAI-SearchBot'a izin vermek: model eğitimi için yapılan tarama durur, ChatGPT Search'teki görünürlüğünüz yerinde kalır. Ama robots.txt bir bariyer değil, rica. Bytespider gibi kuralı tanımayan tarayıcılar için WAF ya da sunucu katmanında ayrı bir engel şart.
Bu sayfa GEO danışmanlığı rehberinin teknik kolundaki erişim katmanını anlatıyor: hangi botun ne topladığı, hangisinin kuralı dinlediği ve dinlemeyeni nerede durduracağınız. İçeriğin botlar tarafındanokunabilir olması ayrı bir konu — orasıJavaScript, SSR ve AI botlarısayfasının işi.
Hangi bot ne yapar: eğitim mi, arama mı?
AI tarayıcıları tek kategori değil. Bir kısmı model ön-eğitimi için korpus topluyor, bir kısmı canlı arama sonucu üretmek üzere sayfayı o an çekiyor, bir kısmı da kullanıcının verdiği URL'yi tek seferlik getiriyor. Üçü de aynı sunucuya vuruyor ama engellemenin sonucu tamamen farklı: birincisi görünürlüğünüze dokunmaz, ikincisi sizi yanıtlardan siler.
Aşağıdaki tabloda "robots.txt Uyumu" sütunu üç değer alıyor: Uyar(şirket kurala saygı duyacağını açıkça taahhüt etmiş), Uymaz(dosyadaki direktif pratikte geçersiz), Tartışmalı (şirket kendisini robots.txt'in kapsamı dışında görüyor).
| Bot | Şirket | İşlev | robots.txt uyumu | Engellemenin görünürlük etkisi |
|---|---|---|---|---|
GPTBot | OpenAI | Model ön-eğitimi | Uyar | ChatGPT Search'e etkisi yok; yalnızca eğitim veri kümesinden çıkarsınız |
OAI-SearchBot | OpenAI | ChatGPT Search (31 Ekim 2024'te duyuruldu) | Uyar | Engellerseniz ChatGPT Search sonuçlarından düşersiniz |
ChatGPT-User/2.0 | OpenAI | Kullanıcı tetiklemeli anlık tarama | Uyar | Gerçek zamanlı URL sorgularında görünmezsiniz |
ClaudeBot | Anthropic | Model ön-eğitim korpusu | Uyar (taahhütlü) | Claude'un eğitim verisinden çıkarsınız; arama görünürlüğü etkilenmez |
Claude-SearchBot | Anthropic | Claude'un web arama aracı | Uyar | Claude'un arama yanıtlarında yer alamazsınız |
Google-Extended | Gemini eğitimi (28 Eylül 2023) | Uyar | Google Search sıralamasını etkilemez | |
CCBot | Common Crawl | Açık kaynak model eğitimi | Uyar (Crawl-delay dahil) | Açık kaynak LLM'lerin eğitim verisinden çıkarsınız |
Bytespider | ByteDance | Doubao LLM eğitimi | Uymaz | robots.txt direktifi geçersiz; sunucu ya da WAF engeli gerekir |
Perplexity-User | Perplexity | Ajan tabanlı tarama | Tartışmalı | "Bot değil, ajan" savunmasıyla direktifi tanımıyor |
Tablodaki en pahalı yanlış anlama şu: "AI botlarını engelledim" diyen çoğu site aslında hem eğitimi hem aramayı birden kapatıyor. GPTBot ile OAI-SearchBot ayrı user-agent'lar ve OpenAI bunları bilerek ayırdı. Eğitimden rahatsızsanız ilkini kapatın; ikincisini kapattığınız anda ChatGPT'nin kaynak listesinden çıkarsınız ve bunun geri dönüşü, dosyayı düzelttikten sonra yeniden taranmayı beklemektir. Aynı ayrım Anthropic tarafında da var: ClaudeBot eğitim, Claude-SearchBot arama.
Tabloda yer almayan ama kayıtlarınızda karşınıza çıkacak birkaç isim daha var: Amazonbot, Applebot-Extended ve meta-externalagent. Applebot-Extended Apple'ın üretken model eğitimini kapsar ve klasik Applebot'tan ayrıdır — yani Siri ve Spotlight tarafındaki görünürlüğünüzü kaybetmeden yalnızca eğitimi kapatabilirsiniz; yapı OpenAI'ınkiyle aynı mantıkta kurulmuş. meta-externalagent ise Meta'nın model eğitim tarayıcısı. Bu üçü kural tanıyan tarafta yer alıyor, dolayısıyla robots.txt satırı gerçekten karşılık buluyor.
Bir de sınıflandırması yeni yeni oturan bir grup var: kullanıcı adına çok adımlı iş yapan tarayıcı ajanları. ChatGPT-User/2.0 bunların en yaygını. Klasik tarayıcı gibi indeks kurmuyor, bir insanın o an verdiği talimatla tek bir sayfayı çekiyor. Erişim kararını verirken bunları "bot" kutusuna atmak, kendi ziyaretçinizi kapıda çevirmekle aynı kapıya çıkıyor.
Perplexity'nin "ajan" savunması
Perplexity, kullanıcı adına sayfa getiren yazılımını bot değil ajan olarak tanımlıyor ve robots.txt'e uymak zorunda olmadığını savunuyor. Argüman şu: dosya otomatik tarayıcıları hedefler, kullanıcının o an talep ettiği bir getirme işlemi ise tarayıcı ziyaretine daha yakındır. Sonuç pratikte dosyanızın Perplexity için bağlayıcı olmamasıdır.
Tartışma teoride kalmadı. Cloudflare 4 Ağustos 2025'te yayımladığı raporda Perplexity'nin user-agent, IP ve ASN sahteciliğine başvuran gizli tarayıcılar kullandığını belgeledi. Bu tek bir altyapı sağlayıcısının kendi ağında yaptığı ölçüm — bağımsız doğrulaması olan bir sektör bulgusu değil, ama kaynağı da rastgele bir blog değil.
Karar verirken şunu ayırın: Perplexity'yi trafik kanalı olarak istiyorsanız engellemek zaten amaca aykırı — o durumda yapılacak işPerplexity'de kaynak gösterilme tarafında. İstemiyorsanız robots.txt satırı size güvence vermez; işi WAF katmanına devredin.
Üç strateji, üç kopya-yapıştır blok
Yapılandırma seçeneği aslında üç tane: yalnızca eğitimi kesmek, her şeyi kapatmak, hiçbir şeye dokunmamak. Hangisini seçeceğiniz yapay zeka arayüzlerinde görünmek isteyip istemediğinize bağlı. Kararı verirken "içeriğim çalınmasın" refleksiyle "yanıtlarda adım geçsin" hedefinin çoğu zaman çeliştiğini hesaba katın.
Blok A — Eğitimi kes, aramada kal. Sitelerin büyük çoğunluğu için doğru başlangıç. Eğitim korpusundan çıkarsınız, ChatGPT Search'te ve kullanıcının elle başlattığı getirmelerde kalırsınız.
User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: /Blok B — Tümünü engelle. Ücretli içerik, üyelik arkası yayıncılık ya da lisanslama pazarlığı yürüten yayıncılar için. Bedeli açık: ChatGPT Search, Claude web araması ve Perplexity yanıtlarından çıkarsınız.
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: / User-agent: Bytespider Disallow: / User-agent: Google-Extended Disallow: /Blok B'deki Bytespider satırı bir niyet beyanı. Dosyayı okumadığı için tek başına hiçbir şey yapmaz; asıl engelsunucu katmanında kurulur.
Blok C — Tümüne izin ver. robots.txt'in varsayılanı zaten izindir, dolayısıyla bu blok teknik olarak gereksiz. Yine de yazmanın bir faydası var: ekipteki bir başkası aylar sonra dosyayı açtığında "burada bir karar verilmiş" görür, kazara Disallow eklemez.
User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: /İki uyarı. Birincisi, robots.txt her ana bilgisayar adı ve protokol için ayrıdır: blog.siteniz.com kendi dosyasını ister, kök alan adınızdaki kural oraya geçmez. İkincisi, Disallow taramayı engeller ama halihazırda eğitilmiş modellerden içeriğinizi geri almaz — geçmişe dönük bir silme mekanizması değil.
Hangi site hangi bloğu seçmeli?
Karar tek bir soruya iniyor: içeriğiniz kendi başına satılan bir ürün mü, yoksa sizi bulunur kılan bir vitrin mi? Birinci gruptaysanız kapatmanın bedeli düşük, ikinci gruptaysanız kapatmak kendi ayağınıza sıkmak. Aradaki fark sektör değil iş modeli — aynı sektörde iki site zıt kararlar verebilir.
Hizmet ve B2B siteleri. Gelir, içeriğin kendisinden değil içeriğin getirdiği görüşmelerden geliyor. Yapay zeka arayüzlerinde kaynak gösterilmek doğrudan işe yarıyor. Blok A mantıklı; hatta eğitim tarafını da açık bırakmak savunulabilir, çünkü marka adınızın model ağırlıklarına girmesi uzun vadede lehinize çalışır.
Yayıncılar ve içerik üreticileri. Burada içerik ürünün kendisi. Reklam ya da abonelik geliri sayfa görüntülemeye bağlıysa, özetlenip kaynak bile gösterilmeden tüketilmek doğrudan gelir kaybı. Blok B ya da Blok A'nın sertleştirilmiş bir hâli tartışılır. Lisans pazarlığı ihtimali varsa Content Signals sinyallerini de eklemek işi kolaylaştırır.
E-ticaret. Ürün sayfalarının yapay zeka yanıtlarında geçmesi neredeyse her zaman istenen bir şey; kapatmak için özel bir sebep olmalı. Buradaki asıl sorun izin değil yük: filtre ve sıralama kombinasyonlarının ürettiği milyonlarca URL, kural tanımayan bir tarayıcı tarafından sonuna kadar dolaşılır. Çözüm robots.txt'te bot adlarıyla uğraşmak değil, parametreli yolları tüm tarayıcılara kapatmak.
Dokümantasyon ve destek merkezleri. En net vaka. Bu içeriğin amacı sorunun cevaplanması; cevabın nerede verildiği ikincil. Açık bırakın, hatta modele okuma haritası sunmayı düşünün.
Cloudflare'in yönetilen robots.txt'i ve "prepend" mantığı
Cloudflare'in yönetilen robots.txt özelliği mevcut dosyanızı silmez. HTTP 200 ile doğrulanmış bir robots.txt varsa yeni kuralları dosyanın önüne ekler; dosya yoksa sıfırdan oluşturur. Bu ayrım önemli, çünkü çakışan kurallarda ilk eşleşen blok kazanır ve sizin elle yazdığınız satırlar Cloudflare'in eklediklerinin altında kalır.
Etkinleştirme yolu: Security Settings → Bot traffic → "Set your preference to block training in robots.txt". Varsayılan olarak Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot ve meta-externalagent için Disallow: / kuralı gelir. Aynı andaUser-Agent: * için search=yes, ai-train=no, use=reference sinyalleri otomatik uygulanır.
Dikkat edilecek nokta, bu varsayılan listede OAI-SearchBotya da Claude-SearchBot bulunmaması — yani özellik kutudan çıktığı haliyle Blok A mantığına yakın davranıyor, eğitimi kesip aramayı açık bırakıyor. Yine de anahtarı çevirmeden önce mevcut dosyanızı bir kez okuyun: WordPress gibi sistemler robots.txt'i fiziksel dosya olmadan dinamik üretir ve bu da 200 döndüğü için Cloudflare "var" kabul edip başa ekleme yapar.
Content Signals: izin ver/engelle ikilisinin ötesi
Content Signals, robots.txt içine yerleştirilen makine tarafından okunabilir direktifler kümesi. Klasik Allow/Disallow yalnızca erişimi düzenler; Content Signals erişilen içeriğin ne içinkullanılabileceğini ayrı bir eksende ifade eder. Tarama izni ile kullanım izni birbirinden ayrılmış olur.
Cloudflare'in test ettiği content-use uzantısı üç düzey tanımlıyor:
use=immediate— içerikle o an etkileşim kurulur, hiçbir şey depolanıp yeniden kullanılamazuse=reference— indeksleme, alıntı ve geri bağlantı serbestuse=full— özetleme ve yeniden üretim dahil en geniş izin düzeyi
Hukuki tarafı burada devreye giriyor. Bu kısıtlamalar AB Direktifi 2019/790 Madde 4 kapsamında hakların açık rezervasyonu olarak ifade edilir. Madde 4, metin ve veri madenciliğine bir istisna tanır ama hak sahibinin bunu makine tarafından okunabilir biçimde saklı tutmasına da izin verir. Content Signals tam olarak o "makine tarafından okunabilir rezervasyon" kutusunu doldurmaya çalışan bir mekanizma.
Türkiye'de yerleşik bir site için bu doğrudan bağlayıcı bir yükümlülük doğurmaz; sinyalin değeri, AB pazarına içerik sunan ya da ileride lisans pazarlığı yapmayı düşünen yayıncılar için niyetin tarihli ve teknik bir kaydını bırakmasında. Sinyali koymanın maliyeti birkaç satır, koymamanın maliyeti ise "itiraz etmediniz" argümanına açık kalmak.
Aynı mantığın içerik tarafındaki karşılığı içinllms.txt nedir sayfasına bakın: robots.txt erişimi düzenler, llms.txt ise modele neyi okuması gerektiğini önerir. İkisi rakip değil, farklı katmanlar.
Content Signals'ın bugünkü zayıf noktası da açık: hiçbir model sağlayıcısı bu sinyallere uymayı taahhüt etmiş değil. Yani teknik bir yaptırım değil, beyan. Değeri, ileride bir uyuşmazlıkta ya da lisans görüşmesinde dayanacağınız kaydı bugünden bırakmak. Dosyaya eklemek beş satır sürüyor, kaldırmak bir o kadar; bu asimetri denemeyi ucuz kılıyor.
robots.txt yetmediğinde: sunucu ve WAF katmanı
robots.txt teknik bir bariyer değil, gönüllü bir anlaşmadır. Dosyayı okumayı seçmeyen bir istemci için hiçbir yaptırımı yok. Gerçek engel HTTP yanıtında kurulur: user-agent ya da IP eşleşmesinde 403 dönmek, hız sınırı uygulamak, şüpheli trafiği doğrulama duvarının arkasına almak.
Bytespider bu sorunun en somut örneği. HAProxy'nin 2024 raporuna göre AI tarayıcı trafiğinin yaklaşık %90'ı Bytespider kaynaklıydı — tek bir altyapı şirketinin kendi ağındaki ölçüm olduğunu akılda tutun, sektör ortalaması değil. Yön olarak söylediği şey yine de net: "AI botlarını engelledim" diyorsanız ama Bytespider'ı sunucu katmanında durdurmadıysanız, engellemenin büyük bölümü kâğıt üzerinde kalıyor.
Cloudflare kullanıyorsanız iş kolay: Bot Management panelindekiAI Scrapers and Crawlers kategorisini etkinleştirmek yeterli. Cloudflare'iniz yoksa nginx tarafında iki adım var — bilinen user-agent dizesini reddetmek ve kalan bot trafiğine hız sınırı koymak.
# http {} bloğunda tanımlanır map $http_user_agent $ai_uyumsuz {default 0; "~*Bytespider" 1;}limit_req_zone $binary_remote_addr zone=botlar:10m rate=5r/s; # server {} bloğunda uygulanır server {if ($ai_uyumsuz) {return 403;}location / {limit_req zone=botlar burst=20 nodelay;}}User-agent eşleşmesi taklit edilebilir bir sinyaldir; kararlı bir engel istiyorsanız bunu IP aralığı kontrolü veya ters DNS doğrulamasıyla birleştirin. Hız sınırındaki değerler örnektir — kendi trafiğinize bakmadan kopyalamayın, meşru arama motoru botlarını da yakalayabilir.
Türkiye'deki kurulumlar için pratik notlar
Türkiye'deki sitelerin önemli bir kısmı paylaşımlı hosting ya da tek VPS üzerinde çalışıyor; nginx yapılandırmasına erişim çoğu zaman yok. O durumda WAF katmanını sunucuda değil, önündeki CDN'de kurarsınız. Cloudflare'in ücretsiz planı bile tek bir user-agent kuralını çalıştırmaya yeter ve alan adı yönlendirmesi dışında bir şey gerektirmez.
Sırasıyla denenecek üç yol var. Alan adınız Cloudflare'e bağlıysa WAF → Custom rules altında http.user_agent contains "Bytespider"ifadesiyle bir Block kuralı açın; ücretsiz planda kural kotası sınırlı ama bu iş için bir kural yetiyor. Cloudflare yoksa ve sunucu Apache ya da LiteSpeed ise .htaccess içindeRewriteCond %{HTTP_USER_AGENT} ile aynı engeli kurabilirsiniz — LiteSpeed .htaccess kurallarını okur, bu yüzden cPanel'li paylaşımlı paketlerde çalışır. Üçüncü seçenek, hosting panelindeki ModSecurity kural setine kendi imzanızı eklemek; sağlayıcı destek talebi isteyebilir.
Maliyet tarafında Türkiye'ye özgü bir mekanizma var ve rakam vermeye gerek yok, muhakeme yetiyor. Paylaşımlı paketlerde fatura bant genişliğinden çokeşzamanlı PHP işlemi kotasına bağlıdır. Kuralı tanımayan bir tarayıcı önbelleğe düşmeyen dinamik URL'leri — arama sonuçları, filtre kombinasyonları, sayfalama zincirleri — hızlı hızlı çektiğinde her istek bir PHP işçisi tutar. Kota dolduğunda sunucu gerçek kullanıcılara da kaynak limiti hatası döndürmeye başlar. Yani zarar "biraz fazla bant genişliği" değil, doğrudan erişilebilirlik kaybı olarak görünür.
İkinci etken oran meselesi. Yalnızca Türkiye'ye hitap eden bir sitenin insan trafiği coğrafi olarak sınırlıdır, oysa tarayıcılar coğrafya tanımaz. Aynı mutlak bot hacmi, aylık ziyaretçisi mütevazı bir sitede toplam isteklerin çok daha büyük bir dilimini kaplar. Küçük siteler bu yükü büyük sitelerden daha ağır hisseder — sezgiye ters ama aritmetik böyle.
Engellemeden önce denenmeye değer bir ara adım var: yükü kesmek için trafiği durdurmak şart değil, ucuzlatmak yetebilir. Bot isteklerinin büyük bölümü zaten aynı birkaç bin sayfaya gidiyor ve bunlar tam sayfa önbelleğinden servis edilebilirse PHP hiç çalışmaz. Türkiye'de yaygın olan LiteSpeed + LSCache ya da WordPress tarafında sunucu düzeyi önbellek kullanan kurulumlarda, önbelleğin oturum açmamış ziyaretçiler için gerçekten devrede olduğunu doğrulamak tek başına sorunu çözebilir. Önbelleğe düşmeyen şey neyse — arama sonuçları, sepet, filtre kombinasyonları — engellenmesi gereken de odur.
Alan adı Türkiye'deki bir sağlayıcıda dursa bile önüne bir CDN koymak bu işi kolaylaştırıyor, çünkü user-agent kuralı uygulama sunucusuna hiç ulaşmadan kenarda çalışır. Kenarda dönen 403, sunucuda dönen 403'ten çok daha ucuz. Kurulumda tek dikkat edilecek nokta, kaynak sunucunun yalnızca CDN üzerinden erişilebilir olması — IP'si doğrudan açık kalırsa kenar kuralı basitçe atlanır.
Tahmin yürütmek yerine ölçün. Sunucu erişim kayıtlarında user-agent bazında istek sayısı, çekilen bayt ve isabet edilen URL desenleri birkaç dakikada çıkar; yöntem log analizi sayfasında. Engellemeden önce ve sonra aynı raporu almak, kuralın işe yarayıp yaramadığını gösteren tek dürüst kanıttır.
Sık yapılan hatalar
robots.txt'in sözdizimi basit görünür, tam da bu yüzden yanlışlar sessizce yaşar. Dosya hatalı olduğunda uyarı almazsınız; yalnızca beklediğiniz şey olmaz. Aşağıdakiler denetimlerde en sık rastladığım kalıplar.
Yıldızla toplu engelleme. User-agent: *altına Disallow: / yazıp "AI botlarını kapattım" sanmak. O satır Googlebot'u da kapsar. AI tarafını hedefleyeceksiniz, botları tek tek adlandırın.
Grupları boş satırla ayırmamak. İki User-agentsatırı arasında boş satır yoksa bunlar tek bir grup sayılır ve altındaki kural ikisine birden uygulanır. Blok A'yı boş satırsız yapıştırırsanız OAI-SearchBot da Disallow yemiş olur — yani tam istemediğiniz şey olur.
Disallow'u noindex sanmak. Engellenen bir sayfa taranmadığı için üzerindeki noindex etiketi de okunamaz. Bir URL'nin dizinden çıkmasını istiyorsanız taramayı açık bırakıp etiketi okutmanız gerekir. İki mekanizma birbirinin yerine geçmez.
Yolları ters işaretlemek. Disallow: /panelile Disallow: /panel/ aynı şey değil; ilki/panelim gibi yolları da kapsar. Ayrıca büyük-küçük harf duyarlıdır.
Dosyanın kendisinin kapalı olması. Bazı güvenlik eklentileri ya da CDN kuralları bot user-agent'larına robots.txt için de 403 döndürür. Bu durumda kural okunmaz, tarayıcı da çoğu zaman "kısıtlama yok" varsayar. Doğrulamayı gerçek user-agent ile yapmanın sebebi bu.
Kuralın işe yaradığını nasıl anlarsınız?
Dosyayı yayımlamak doğrulama değildir. Üç şeye ayrı ayrı bakın: dosya doğru servis ediliyor mu, uyumlu botlar kurala uymuş mu, uyumsuz olanlar gerçekten 403 alıyor mu. Üçü farklı yerlerden görünür ve biri düzelirken diğeri bozulabilir.
İlki en basiti: curl -A "GPTBot" https://siteniz.com/robots.txtile dosyanın 200 döndüğünü ve içeriğin beklediğiniz gibi olduğunu görün. Cloudflare'in yönetilen kuralları devredeyse çıktının başında sizin yazmadığınız satırlar belirecek — prepend mantığı burada gözle görülür hale gelir. Aynı kontrolü kimliksiz bir user-agent ile tekrarlayıp iki çıktıyı karşılaştırmak da işe yarar: aralarında fark varsa dosyayı koşullu servis eden bir katman var demektir ve bu, kuralın bazı botlara hiç ulaşmadığı anlamına gelir.
İkincisi kayıt dosyalarında. Disallow verdiğiniz bir bot kuralı okuduktan sonra genellikle robots.txt'e uğramaya devam eder ama içerik URL'lerini çekmeyi bırakır; kayıtlarda bu deseni görene kadar "engellendi" demeyin. Uyumsuz botlarda ise bakılacak şey 403 oranı: istek sayısı düşmeyebilir, düşmesi gereken şey 200 dönen istek sayısıdır.
Üçüncüsü sonuç tarafı. Erişim kararlarının yapay zeka görünürlüğüne etkisiniGEO KPI ölçümüçerçevesiyle izleyin; teknik kontrolü rutine bağlamak istersenizGEO teknik denetimlistesinde robots.txt maddesi var. Tarama bütçesi ve dosya hijyeninin klasik arama tarafındaki karşılıkları dateknik SEO altında duruyor.
Erişimi tümden kapatmak yerine kontrollü bir kanal açmak isteyenler için üçüncü bir yol daha var: yapılandırılmış veriyi modele sunucu üzerinden vermek. MCP ve NLWebsayfası bu yaklaşımı ele alıyor. Kaynak gösterilme tarafındaki içerik kararları içinse ChatGPT GEO rehberi.
Sıkça Sorulan Sorular
GPTBot'u engellemek ChatGPT Search'ten çıkarır mı?
Hayır. GPTBot'u engelleyip OAI-SearchBot'a izin verirseniz eğitim taramasını durdururken ChatGPT Search'teki görünürlüğünüzü korursunuz. İkisi ayrı user-agent, ayrı boru hattı.
Google-Extended'ı engellemek arama sıralamama zarar verir mi?
Vermez. Google-Extended yalnızca Gemini gibi yapay zeka ürünleri için veri toplar; Google Search'ün tarama ve sıralama süreçlerinden bağımsızdır.
CCBot'u engellemek GPTBot'u da engeller mi?
Hayır, bunlar birbirinden bağımsız boru hatları. CCBot Common Crawl arşivini besler; o arşivi kullanan başka modeller olabilir ama OpenAI'ın kendi taraması ayrı yürür. Birini kapatmak diğerini kapatmaz.
Perplexity robots.txt'e uyuyor mu?
Kısmen. Perplexity-User için şirket "bu bir bot değil, ajan" argümanını öne sürüyor ve direktifi bağlayıcı saymıyor. Cloudflare'in 4 Ağustos 2025 tarihli raporu ayrıca user-agent, IP ve ASN sahteciliği yapan gizli tarayıcılar belgeledi — bu tek bir sağlayıcının kendi ağındaki gözlemi. Engelleme niyetiniz ciddiyse WAF ya da sunucu düzeyi daha güvenilir.
ChatGPT-User'ı engellemeli miyim?
Neredeyse hiçbir zaman. Bu, bir kullanıcının ChatGPT üzerinden sitenize yaptığı gerçek zamanlı getirme isteğidir; engellemek insanın kendi elleriyle istediği şeyi kırmak anlamına gelir.
llms.txt robots.txt'in yerini alır mı?
Almaz. robots.txt erişim izniyle ilgilenir ve yaygın biçimde tanınır; llms.txt ise modele hangi içeriğin okunmaya değer olduğunu öneren, henüz standartlaşmamış bir dosyadır. Biri kapıyı, diğeri kapının içindeki yönlendirme tabelasını düzenler.
Alt alan adlarım için ayrı robots.txt gerekir mi?
Evet. Kural her ana bilgisayar adı ve protokol için ayrıdır; kök alan adınızdaki dosya blog.siteniz.com ya dashop.siteniz.com için geçerli olmaz. Alt alan adında sık unutulan tuzak budur.
robots.txt'i ne sıklıkla güncellemeliyim?
Takvime değil tetikleyiciye bağlayın: yeni bir büyük LLM şirketi tarayıcı duyurduğunda, mevcut bir botun davranışı değiştiğinde ya da içerik stratejiniz değiştiğinde. OpenAI ve Anthropic kuralları saygıyla karşılayacaklarını kamuoyu önünde taahhüt etti, dolayısıyla bu iki tarafta değişiklik genelde yeni user-agent eklenmesi biçiminde gelir. Yılda bir de olsa dosyayı açıp okumak, unutulmuş bir Disallow satırını yakalamanın en ucuz yolu.
Erişim kurallarını içerik ve ölçüm tarafıyla birlikte kurgulamak istersenizGEO danışmanlığı sayfasından başlayın.

