Claude-SearchBot Nedir?
Kısa tanım
Claude-SearchBot, Anthropic'in kullanıcılara sunulan arama sonuçlarının kalitesini artırmak için web'de gezinen ve çevrim içi içeriği analiz eden botudur. Anthropic'e göre engellenmesi, içeriğin arama optimizasyonu için dizine eklenmesini önler ve sitenin kullanıcı arama sonuçlarındaki görünürlüğünü ve doğruluğunu azaltabilir. Model eğitimi için içerik toplayan ClaudeBot'tan ve kullanıcı isteğiyle sayfa getiren Claude-User'dan ayrı yönetilir.
Diğer adları: Claude SearchBot, Claude-SearchBot user agent, Anthropic arama botu, Claude arama botu

Anthropic'in tarifi
Anthropic, web'e erişen botlarını anlattığı yardım makalesinde Claude-SearchBot'u, kullanıcılar için arama sonuçlarının kalitesini artırmak amacıyla web'de gezinen bir bot olarak tanımlar. Makaleye göre bot, çevrim içi içeriği özellikle arama yanıtlarının alakasını ve doğruluğunu iyileştirmek için analiz eder. Engellendiğinde sistem içeriği arama optimizasyonu için dizine ekleyemez; bu da sitenin Claude'un yapay zekâ arama sonuçlarındaki görünürlüğünü ve doğruluğunu azaltabilir.
Belgeyi okurken iki noktaya dikkat etmek gerekir. Birincisi, Anthropic bu bot için tam bir user-agent dizesi yayımlamaz; robots.txt'de kullanılacak ad Claude-SearchBot'tur. İkincisi, makale Claude'un cevaplarında kaynakların nasıl seçildiğini ya da sıralandığını anlatmaz. Erişim izni bir ön koşuldur, kaynak gösterilmenin garantisi değildir.
Önceden dizinlemek ile anlık getirmek
Yapay zekâ asistanlarının web'den bilgi almasının iki yolu vardır. Birincisinde bir bot sayfaları önceden ziyaret eder ve arama sırasında kullanılacak bir dizin oluşturur; Anthropic tarafında bu rol Claude-SearchBot'undur. İkincisinde sayfa, kullanıcı soruyu sorduğu anda getirilir; bu iş Claude-User'a aittir. OpenAI'de aynı ayrım OAI-SearchBot ile ChatGPT-User arasında yapılır.
Pratikteki fark şudur: önceden dizinlenmemiş bir sayfanın, kullanıcı onu adıyla ya da bağlantısıyla sormadıkça bir aramada aday olarak öne çıkması zorlaşır. Anthropic iki botun birlikte nasıl çalıştığını ayrıntılı açıklamadığı için kesin bir mekanizma varsaymamak, ama ikisini birbirinin yerine geçen ayarlar olarak da görmemek gerekir.
Alt alan adları ve tarama hızı
Anthropic, botlarının robots.txt'deki standart "taramayın" yönergelerine uyduğunu ve engelleme kuralının devre dışı bırakılmak istenen her alt alan adında ayrıca uygulanması gerektiğini belirtir. robots.txt her ana makine (host) için ayrı okunduğundan, ornek.com için yazılan kural portal.ornek.com için geçerli olmaz. Ana sitede arama dizinine açık kalıp müşteri portalını kapatmak için iki ayrı dosya gerekir:
# https://ornek.com/robots.txt
User-agent: Claude-SearchBot
Allow: /
Disallow: /sepet/
# https://portal.ornek.com/robots.txt
User-agent: Claude-SearchBot
Disallow: /Anthropic, standart dışı Crawl-delay uzantısını da desteklediğini söyler. Sunucu yükü bir endişeyse, botu tamamen engellemek yerine istekleri seyreltmek arama görünürlüğünü korurken yükü azaltabilir.
Engellemeden önce bakılacaklar
- Eğitim tercihi ayrı bir ayardır. İçeriğin model eğitiminde kullanılmasını istemiyorsanız ilgili bot ClaudeBot'tur. Claude-SearchBot'u engellemek bu amaca hizmet etmez, yalnızca arama görünürlüğünü düşürür.
- IP engeli önerilmez. Anthropic, IP adreslerini engellemenin botların robots.txt dosyasını okumasını da engellediği için doğru ya da kalıcı bir devre dışı bırakma sağlamayabileceğini belirtir. Kaynak IP'leri doğrulamak için
https://claude.com/crawling/bots.jsonlistesini yayımlar. - Doğrulama sayfaları sessiz bir engeldir. Anthropic, botlarının CAPTCHA'ları aşmaya çalışmadığını söyler. Güvenlik duvarınız tanımadığı trafiğe sınama sayfası gösteriyorsa, robots.txt izin verse bile bot içeriğe ulaşamaz. Bu katmanlar bot erişilebilirliği maddesinde ele alınıyor.

