İletişim

Sıcaklık Parametresi (Temperature) Nedir?

Kısa tanım

Sıcaklık (temperature), bir dil modelinin bir sonraki token'ı seçerken olasılık dağılımını ne kadar keskinleştireceğini ya da düzleştireceğini belirleyen örnekleme parametresidir. Düşük değerler en olası token'lara yoğunlaşan, daha tutarlı çıktılar; yüksek değerler daha çeşitli ve öngörülmesi zor çıktılar üretir. Sıcaklığı sıfıra çekmek bile her ortamda birebir aynı cevabı garanti etmez.

Diğer adları: temperature, sampling temperature, örnekleme sıcaklığı, top-p, nucleus sampling

Sıcaklık değeri arttıkça dil modelinin sonraki kelime olasılıklarının düzleştiğini ve çıktının çeşitlendiğini gösteren tablo

Olasılık dağılımı nasıl değişir?

Sıcaklık, çıkarım sırasında her adımda devreye girer. Model, kelime dağarcığındaki her token için bir ham puan (logit) üretir; bu puanlar softmax fonksiyonuyla olasılığa çevrilir ve bir sonraki token bu dağılımdan seçilir. Sıcaklık, softmax'tan önce bütün puanların bölündüğü sayıdır. 1'den küçük bir değer puanlar arasındaki farkları büyütür ve en olası token'ı daha da baskın hale getirir. 1'den büyük bir değer farkları küçültür ve düşük olasılıklı seçeneklere şans tanır.

Ham puanları 2,0; 1,0 ve 0,5 olan üç aday token düşünün. Farklı sıcaklıklarda seçilme olasılıkları şöyle değişir:

AdayT = 0,5T = 1,0T = 1,5
A (puan 2,0)%84,4%62,9%53,2
B (puan 1,0)%11,4%23,1%27,3
C (puan 0,5)%4,2%14,0%19,6

Sıcaklık sıfıra yaklaştıkça dağılım tek bir token'a yığılır. Bu uç durum, her adımda en olası token'ın seçildiği açgözlü (greedy) kod çözmeye karşılık gelir.

top-p ve top-k: kuyruğu kesmek

Sıcaklık dağılımın şeklini değiştirir; top-p ve top-k ise seçimin dağılımın hangi kısmından yapılacağını sınırlar.

  • top-k: Yalnızca en olası k token arasından seçim yapılır.
  • top-p (nucleus sampling): Token'lar olasılığa göre sıralanır ve toplam olasılık p değerine ulaşana kadar aday kümesine eklenir. Yukarıdaki tabloda T = 1,0 iken top-p = 0,8 seçilirse A ve B kalır (%62,9 + %23,1 = %86), C elenir ve kalan iki olasılık yeniden ölçeklenir.

OpenAI'nin API belgeleri sıcaklığı ya da top_p'yi değiştirmeyi, ikisini birden değiştirmemeyi önerir. Sınıflandırma gibi tutarlılık isteyen bir iş için tipik bir istek şöyle görünür:

{
  "model": "<model-adı>",
  "input": "Bu yorumu olumlu, olumsuz ya da nötr olarak sınıflandır: ...",
  "temperature": 0.2
}

Aynı ad, farklı aralıklar

Parametrenin adı aynı olsa da aralığı ve desteği sağlayıcıya, hatta modele göre değişir. OpenAI'nin Responses API'sinde sıcaklık 0 ile 2 arasında ayarlanır. Anthropic'in Messages API'sinde aralık 0 ile 1, varsayılan değer 1,0'dır. Anthropic ayrıca Claude Opus 4.6'dan sonra çıkan modellerin sıcaklık ayarını desteklemediğini ve geriye dönük uyumluluk için yalnızca 1,0 değerini kabul ettiğini belgeler. Bu yüzden bir sağlayıcıdan ötekine taşınan "temperature: 0.7" ayarı aynı davranışı üretmez; model değiştirirken örnekleme ayarlarını yeniden test etmek gerekir.

Sıfır sıcaklık birebir aynı cevap demek değildir

Yaygın bir varsayım, sıcaklık 0 olduğunda modelin her seferinde aynı cevabı vereceğidir. Anthropic'in API belgesi bunu açıkça düzeltir: sıcaklık 0,0 olsa bile sonuçlar tamamen deterministik olmaz. Pratik nedenler arasında paralel donanımda kayan nokta işlemlerinin sırasının değişebilmesi, isteklerin farklı gruplar halinde işlenmesi ve sağlayıcı tarafındaki model güncellemeleri sayılabilir. Olasılıkları birbirine çok yakın iki token arasındaki küçük bir sayısal fark, cevabın geri kalanını başka bir yöne götürebilir.

Tekrarlanabilirlik gereken işlerde yalnızca sıcaklığa güvenmek yerine model sürümünü, prompt'u ve tüm parametreleri kayıt altına almak, çıktıyı bir şemayla doğrulamak ve kritik kararları birden fazla çalıştırmanın sonucuna göre vermek daha sağlam bir yoldur.

Görünürlük ölçümüne etkisi

Örneklemedeki rastlantısallık, yapay zekâ cevaplarındaki görünürlüğü ölçerken de hesaba katılmalıdır. Aynı soruyu bir yapay zekâ asistanına iki kez sorup farklı kaynaklar ve farklı marka adları içeren iki cevap almak olağandır. Tek bir ekran görüntüsü, bir markanın görünür olup olmadığına dair güvenilir bir kanıt sayılmaz. AI ses payı gibi ölçümler, aynı soruyu birçok kez çalıştırıp sonucu oran olarak raporladığında anlam kazanır. Yüksek sıcaklıkta modelin olası olmayan ayrıntılara sapma ihtimalinin arttığı da unutulmamalıdır; bu risk halüsinasyon maddesinde ele alınıyor.

İlgili terimler

← Sözlüğe dön