llms.txt ve robots.txt: iki dosya, iki iş.
robots.txt bir tarayıcıya nereye girebileceğini söyler; llms.txt bir modele sitenin ne olduğunu ve neyi nerede bulacağını söyler.
İki dosya da sitenin kökünde durur, ikisi de düz metindir ve isimleri benzer — bu yüzden sık karıştırılırlar. Ama işleri tamamen farklıdır ve biri diğerinin yerine geçmez. Farkı anlamak, ikisinden de doğru şeyi beklemeyi sağlar.
robots.txt otuz yıllık bir standarttır, arama motorlarının tamamı tarafından tanınır ve bir ERİŞİM protokolüdür: hangi yol taranabilir, hangisi taranamaz. llms.txt ise yeni bir öneridir, hiçbir motor tarafından resmî olarak desteklenmez ve bir HARİTA'dır: sitenin özeti, ana bölümleri ve önemli sayfaların listesi.
İki dosyanın işleri
- robots.txt — erişim izni. Hangi ajan nereye girebilir. Yaygın olarak tanınır ve uyulur.
- robots.txt — sitemap bildirimi. Keşfin başlangıç noktası.
- llms.txt — sitenin ne olduğunun tek paragraflık özeti.
- llms.txt — ana bölümlerin ve önemli sayfaların açıklamalı listesi.
- llms.txt — doğrulanabilir olguların derli toplu hâli.
Bir şeyi açıkça söylemek gerekiyor: llms.txt'in Google tarafından okunduğuna dair bir kanıt yok ve şirket böyle bir destek ilan etmedi. Diğer yanıt motorları için de durum benzer — bazıları okuyabilir, bazıları okumaz. Bu dosyayı koymak bir garanti değil, düşük maliyetli bir bahistir.
Peki neden yine de yazılır? Üç gerekçe var ve üçü de dosyanın kendisinden bağımsız.
Birincisi, dosyayı yazma egzersizi sitenin kendisini netleştiriyor. Bir siteyi tek paragrafta özetlemek ve ana sayfalarını birer cümleyle tanımlamak zorunda kalmak, sitenin gerçekten ne anlattığını görmeye zorluyor. Bu netlik sonra sayfa başlıklarına ve açıklamalarına da yansıyor.
İkincisi, maliyet neredeyse sıfır. Üreticiden çıkan bir dosya, sayfalar değiştikçe kendiliğinden güncelleniyor. Elle bakım gerektiren bir kalem değilse, düşük olasılıklı bir getiri bile makul.
Üçüncüsü, standart tutmasa bile içeriğin kendisi başka yerlerde işe yarıyor: aynı özet ve aynı olgu listesi, ana sayfa açıklamasında, şemada ve sosyal kartlarda kullanılabiliyor.
llms.txt bir garanti değil, düşük maliyetli bir bahis — ve asıl faydası onu yazarken ortaya çıkıyor.
Bu sitedeki uygulama
Bu sitenin llms.txt'i üreticiden çıkar ve elle düzenlenmez. İçinde sitenin tanımı, üç dilin bildirimi, ana sayfaların açıklamalı listesi, vaka çalışmaları, journal yazıları ve bir «doğrulanabilir gerçekler» bölümü bulunur.
Son bölüm bilinçli bir tercih: dosya pazarlama dili değil olgu taşır. Kurucu kim, kaç dil, hangi teknoloji, hangi projeler. Bir modelin doğrulayabileceği ve başka kaynaklarla çakıştırabileceği türden bilgiler.
Ve bir tutarlılık kuralı: dosyadaki her URL gerçek olmalı ve her iddia sitenin kendisinde de doğrulanabilmelidir. Doğrulama süiti, llms.txt'teki bağlantıların ekrandaki bloklarla eşleştiğini her koşumda ölçüyor — dosya bir gün yalan söylerse test kalır.
Hangisi önce
Sıra tartışmasızdır: robots.txt önce gelir. Erişim izni yoksa hiçbir harita işe yaramaz. Bir sitenin yanıt motoru hazırlığı yapılırken ilk bakılacak yer robots.txt, ikinci bakılacak yer sunucu loglarıdır — tarayıcı gerçekten geliyor mu?
llms.txt ise en sona bırakılabilir. Erişim çalışıyorsa, içerik yapısı temizse ve şema kuruluysa, bu dosya küçük bir ek katmandır. Erişim kırıksa, dosyanın hiçbir anlamı yoktur.
Pratik özet: robots.txt bir zorunluluk, llms.txt bir tercih. Birincisi yanlış yazıldığında görünürlük kapanır; ikincisi hiç yazılmadığında bir şey kaybedilmez — ama yazma egzersizinin kendisi sitenin diline iyi geliyor.
Dosyanın içine ne yazılır
llms.txt'in biçimi bir öneri olarak tanımlanmış ve katı değil, ama işe yarayan bir yapı var. Bir başlık, bir özet paragrafı, bölüm başlıkları altında açıklamalı bağlantı listeleri, ve varsa doğrulanabilir olgular.
- Başlık — sitenin adı. Kısa ve marka olarak yazılır.
- Özet — sitenin ne olduğu, tek paragrafta. Pazarlama dili değil tanım dili.
- Bölümler — ana sayfa grupları, her bağlantının yanında bir cümlelik açıklama.
- Olgular — doğrulanabilir bilgiler: kurulum yılı, diller, teknoloji, ölçülmüş sayılar.
- Bağlantılar — sitemap ve varsa besleme adresleri.
Açıklama cümleleri en değerli kısımdır çünkü modelin sayfayı açmadan ne olduğunu anlamasını sağlar. Bir cümlenin işi, o sayfanın hangi soruyu cevapladığını söylemektir — başlığı tekrar etmek değil.
Ve dosyanın üretici tarafından yazılması, elle yazılmasından her zaman iyidir. Elle yazılan bir harita, sayfalar değiştikçe bayatlar ve bayat bir harita hiç harita olmamasından kötüdür — modele var olmayan sayfalar gösterir.
Tutarlılık: dosyanın yalan söylememesi
Bir haritanın tek gerçek şartı, gösterdiği yerin orada olmasıdır. llms.txt'te listelenen bir sayfa yayından kaldırıldığında ya da adresi değiştiğinde dosya sessizce yalan söylemeye başlar — ve bir modeli var olmayan sayfalara yönlendiren bir harita, hiç harita olmamasından kötüdür çünkü güveni bozar. Bu yüzden dosyanın elle değil üreticiden çıkması, tercih değil zorunluluktur: sayfalar değiştikçe harita da değişir, ve arada insan hatası yaşamaz.
Aynı tutarlılık iddialar için de geçerli. Dosyadaki «doğrulanabilir gerçekler» bölümü, sitenin başka yerlerinde de görünen ve ölçülebilen bilgiler taşımalıdır. Kaç dil, hangi teknoloji, hangi projeler — hepsi sayfalarda da doğrulanabilir olmalı. Bu sitede doğrulama süiti, llms.txt'teki bağlantı listesinin ekrandaki bloklarla eşleştiğini her koşumda ölçüyor; dosya bir gün ayrışırsa test kırmızı yanar ve fark dağıtım anında görünür.
Son bir pratik not: dosyanın içerik tipi düz metin olmalı ve tarayıcıda açıldığında okunabilir görünmelidir. Bazı sunucu yapılandırmaları uzantısı bilinmeyen dosyaları indirme olarak sunar ya da yanlış tipte gönderir; bu durumda dosya teknik olarak vardır ama okunamaz. Kontrol basittir — adresi tarayıcıda aç, metin olarak göründüğünden emin ol, ve yanıt kodunun iki yüz olduğunu doğrula. Bu üç kontrol otomatikleştirilebilir ve otomatikleştirilmelidir, çünkü sunucu yapılandırması bir gün sessizce değişebilir.