İletişim

Transformer Mimarisi Nedir?

Kısa tanım

Transformer, 2017'de yayımlanan “Attention Is All You Need” makalesiyle tanıtılan ve dikkat (attention) mekanizmasına dayanan sinir ağı mimarisidir. Metni kelime kelime sırayla işlemek yerine bir dizideki tüm token'ları birlikte ele alır ve her birinin diğerleriyle ne kadar ilişkili olduğunu hesaplar. Bugünkü büyük dil modellerinin ve birçok görüntü ve çok kipli modelin temelinde bu mimari bulunur.

Diğer adları: Transformer, Transformer modeli, dikkat mekanizması, attention, self-attention, öz-dikkat

Transformer mimarisindeki öz dikkat mekanizmasında bir tokenin cümledeki diğer tokenlere ağırlık verdiğini gösteren diyagram

Transformer'dan önce dil nasıl işleniyordu?

2017'ye kadar dil işlemede yaygın yaklaşım, RNN ve LSTM gibi yinelemeli ağlardı. Bu ağlar cümleyi soldan sağa, bir kelimeyi işledikten sonra ötekine geçerek okur. Bu iki soruna yol açıyordu: Uzun bir cümlenin başındaki bir bilgi sona gelindiğinde zayıflıyordu ve işlem sıralı olduğu için eğitim, modern donanımda paralel çalıştırılmaya pek elverişli değildi.

Google araştırmacılarının “Attention Is All You Need” başlıklı makalesi, yinelemeyi tümüyle bırakıp yalnızca dikkat mekanizmasına dayanan bir mimari önerdi. Makalede ilk sınanan görev makine çevirisiydi; ancak mimari kısa sürede dilin neredeyse her alanına, ardından görüntü ve sese yayıldı.

Dikkat mekanizması: her token diğerlerine bakar

“Kediyi veterinere götürdük, çünkü o iki gündür yemek yemiyordu.” cümlesinde “o” zamirinin kediyi gösterdiğini bir insan hemen anlar. Dikkat mekanizması bu tür ilişkileri sayısal olarak kurar. Kavramsal olarak her token için üç vektör üretilir:

  • Sorgu (query): “Ben neyle ilişkiliyim?” sorusunun temsili.
  • Anahtar (key): Her token'ın kendini diğerlerine tanıttığı etiket.
  • Değer (value): Token'ın aktaracağı asıl içerik.

Bir token'ın sorgusu, dizideki bütün anahtarlarla karşılaştırılır; uyum puanları ağırlığa dönüştürülür ve değerler bu ağırlıklarla harmanlanır. Böylece “o” token'ının yeni temsili, büyük ölçüde “kedi” token'ından beslenir. Model bunu tek bir bakışla değil, aynı anda çalışan birçok dikkat başlığıyla (multi-head attention) yapar; bir başlık zamir ilişkilerini, bir diğeri özne-yüklem uyumunu yakalayabilir. Dikkat kendi başına sıraya duyarsız olduğu için token'ların konum bilgisi ayrıca eklenir.

Encoder, decoder ve bugünkü model aileleri

YapıÖrnek ailelerTipik kullanım
Yalnızca encoderBERT ve türevleriSınıflandırma, varlık tanıma, embedding üretimi
Yalnızca decoderGPT tarzı modellerMetin ve kod üretimi, sohbet
Encoder-decoderOrijinal Transformer, T5Çeviri, özetleme

Bugün sohbet asistanlarının arkasındaki büyük dil modellerinin çoğu yalnızca decoder kullanır ve metni token token üretir. Encoder tabanlı modeller ise anlamsal aramada kullanılan embedding vektörlerinin yaygın kaynağıdır.

Mimarinin bedeli: bağlam uzadıkça artan maliyet

Standart dikkat mekanizmasında her token diğer her token'la karşılaştırılır. Dizi iki katına çıktığında karşılaştırma sayısı kabaca dört katına çıkar. Modellerin bir seferde işleyebildiği metin miktarının, yani bağlam penceresinin sınırlı olmasının ve uzun girdilerin daha pahalı olmasının temel nedenlerinden biri budur. Bu maliyeti azaltan pek çok dikkat varyantı geliştirilmiştir, ama hesap ile bellek arasındaki denge her mimaride bir tasarım kararı olarak kalır. Maliyetin token üzerinden ölçülmesi de bu yapının doğrudan sonucudur.

Bilmek pratikte neye yarar?

Transformer'ı anlamak model seçmeyi ve sonuçları yorumlamayı kolaylaştırır. Modelin bir cevabı neden bağlamdaki belgeye dayandırabildiğini, neden çok uzun girdilerde ortadaki ayrıntıyı kaçırabildiğini ya da neden aynı kelimenin farklı cümlelerde farklı temsil aldığını açıklar. Kelimeyi sabit bir sözlük anlamıyla değil, çevresiyle birlikte temsil etmek, modern doğal dil işlemenin eski anahtar kelime eşleştirme yöntemlerinden ayrıldığı noktadır.

İlgili terimler

← Sözlüğe dön