Parçalama (Chunking) Nedir?
Kısa tanım
Parçalama (chunking), uzun belgelerin embedding'e dönüştürülüp dizine eklenmeden önce daha küçük, kendi başına anlamlı metin parçalarına bölünmesidir. RAG ve yapay zekâ arama sistemleri belgeleri bütün olarak değil, bu parçalar üzerinden getirir. Parça boyutu, parçalar arasındaki örtüşme ve bölme sınırlarının nereye konduğu, doğru bilginin bulunup bulunmayacağını doğrudan etkiler.
Diğer adları: chunking, chunk, belge parçası, document chunk, anlamsal parçalama, semantic chunking

Belgeyi neden bölmek gerekir?
Bir RAG sistemi bir soruyu cevaplarken belgelerin tamamını değil, soruyla en ilgili birkaç parçayı dil modeline verir. Bunun üç nedeni var. Birincisi, embedding modellerinin işleyebildiği metin uzunluğu sınırlıdır. İkincisi, yirmi sayfalık bir belgeyi tek bir vektöre sıkıştırmak, içindeki onlarca konunun anlamını bir ortalamaya çevirir; belirli bir soruyu cevaplayan tek paragraf bu ortalamada kaybolur. Üçüncüsü, modelin bağlam penceresi sınırlıdır ve her token'ın bir maliyeti vardır; okunacak metnin seçici olması gerekir.
Bu yüzden belgeler dizine eklenmeden önce parçalara (chunk) ayrılır. Her parça kendi embedding'ini alır ve getirme aşamasında ayrı bir aday olarak yarışır.
Başlıca stratejiler
| Strateji | Nasıl böler? | Nerede işe yarar? |
|---|---|---|
| Sabit boyutlu | Belirli sayıda token'da keser; genellikle parçalar arasında örtüşme bırakır | Hızlı bir başlangıç, yapısı belirsiz düz metin |
| Yinelemeli, yapıya duyarlı | Önce başlıklardan, sonra paragraflardan, gerekirse cümlelerden böler | Başlık hiyerarşisi olan web sayfaları ve dokümantasyon |
| Anlamsal parçalama | Ardışık cümlelerin embedding benzerliğinin belirgin biçimde düştüğü yerde yeni parça başlatır | Konu geçişlerinin başlıkla işaretlenmediği uzun metinler |
| Belge türüne özel | Kodu fonksiyonlara, tabloyu satır gruplarına, SSS'yi soru-cevap çiftlerine ayırır | Kod depoları, ürün katalogları, yardım merkezleri |
Anlamsal parçalama kulağa en akıllı yöntem gibi gelir, ama her cümle için embedding hesaplamayı gerektirir ve eşik iyi ayarlanmazsa boyutları çok farklı parçalar üretir. Başlıkları düzgün kurulmuş bir belgede yapıya duyarlı bölme çoğu zaman benzer bir sonucu daha ucuza verir.
Boyut, örtüşme ve meta veri
Parça boyutu bir dengedir. Küçük parçalar (örneğin 150–200 token) bir soruyla isabetle eşleşir ama bağlamını kaybeder: "Bu ayar yalnızca kurumsal pakette geçerlidir" cümlesi, hangi ayardan söz edildiğini anlatan önceki paragraftan koparsa işe yaramaz. Büyük parçalar (örneğin 1.000 token ve üzeri) bağlamı korur, ama birden fazla konu taşıdıkları için embedding'leri bulanıklaşır. Bu aralıklar yalnızca örnektir; doğru değer, gerçek sorulardan oluşan bir test setinde denenerek bulunur.
İki iyileştirme yaygındır. Örtüşme (overlap), bir parçanın son birkaç cümlesini sonraki parçanın başında tekrarlayarak sınırda bölünen bilgiyi korur. Meta veri ise her parçaya belge başlığını, bölüm yolunu ve URL'yi iliştirir:
{
"text": "Kurumsal pakette yedekler 90 gün saklanır...",
"doc_title": "Yedekleme ve Geri Yükleme",
"section_path": "Paketler > Kurumsal > Yedekleme",
"url": "https://ornek.com/yardim/yedekleme#kurumsal"
}Böylece parça getirme sırasında hangi bağlama ait olduğunu taşır ve cevapta doğru kaynağa bağlantı verilebilir.
Kötü parçalamanın belirtileri
- Bir tablonun başlık satırı bir parçada, verileri başka bir parçada kalır; model sayıların neyi ifade ettiğini bilemez.
- Bir sorunun cevabı iki parçaya bölünür ve hiçbiri tek başına yeterince benzer görünmediği için getirilmez.
- Parçalar "yukarıda belirtildiği gibi" ya da "bu yöntem" gibi ifadelerle başlar ve tek başına okunduğunda bir şey söylemez.
- Menü, alt bilgi ve çerez bildirimi metinleri her parçaya karışır ve benzerlik puanlarını bozar.
Web içeriği yazanlar için anlamı
Bir yapay zekâ arama sisteminin sayfanızı nasıl böldüğünü kontrol edemezsiniz, ama hangi strateji kullanılırsa kullanılsın daha az zarar görecek içerik yazabilirsiniz. Anlamlı bir başlık yapısı, her bölümün tek bir soruya odaklanması ve paragrafların önceki metne yaslanmadan anlaşılması, sayfa hangi noktadan kesilirse kesilsin kullanılabilir parçalar çıkmasını sağlar. Bu özellik cevap çıkarılabilirliği ile yakından ilgilidir; parçaların bir sorguya göre nasıl seçildiği ise pasaj getirme maddesinin konusudur.

