İçeriğe geç
Educora
Başlangıç16 dk3 / 10

Büyük dil modelleri nasıl çalışır

Tokenler, bir sonraki tokenin tahmini, eğitim ve çıkarım, bağlam penceresi ve modellerin neden halüsinasyon gördüğü; sohbet asistanlarının içine sade bir bakış.

Kendini test et
Bu derste öğreneceklerin
  • Tokenin ne olduğunu ve modelin metni nasıl ürettiğini açıklamak
  • Eğitim ile çıkarımı ayırt etmek
  • Bağlam penceresinin ve bilgi kesim tarihinin etkisini anlamak
  • Halüsinasyonların nedenini açıklamak ve onları kontrol edebilmek

Telefonda mesaj yazarken klavye bir sonraki kelimeyi önerir: “İyi” yazarsın, o da “akşamlar” der. Büyük bir dil modeli özünde aynı fikrin çok daha güçlü bir sürümüdür. Bu derste ChatGPT, Claude, Gemini, Copilot ve benzeri asistanların içine bakacak, hem güçlü yanlarını hem de tipik hatalarını anlayacaksın.

Tanım
Büyük dil modeli (LLM)

Devasa miktarda metin üzerinde bir sonraki metin parçasını tahmin etmek için eğitilmiş, milyarlarca parametreli bir yapay sinir ağı. Sohbet asistanları bu tür modellerin üzerine kurulur.

Tokenler: model metni nasıl okur

Bir model harfleri ya da bütün kelimeleri değil, token adı verilen metin parçalarını okur. Token sık kullanılan bir kelime, uzun bir kelimenin bir parçası, önündeki boşlukla birlikte bir kelime veya bir noktalama işareti olabilir. Her token bir sayıya dönüştürülür ve yapay sinir ağı bu sayılarla çalışır.

Text
Text:    Tokenization is unbelievably useful!
Tokens:  Token | ization | is | un | believ | ably | useful | !
         → 8 tokens for 4 words and 1 sign
IDs:     each token becomes a number, e.g. 'useful' → 5505
Temsilî bir bölme. Her model ailesinin kendi tokenizer'ı vardır; bu yüzden parçalar ve numaralar farklıdır.

İngilizcede bir token ortalama olarak bir kelimenin yaklaşık dörtte üçüdür. Azerbaycanca, Rusça ve Türkçedeki kelimeler çoğu zaman daha fazla parçaya bölünür; bu yüzden aynı metin bu dillerde genellikle daha fazla token tutar. Bu önemlidir, çünkü modellerin sınırları ve fiyatları tokenle ölçülür.

Tek görev: bir sonraki tokeni tahmin etmek

Büyük bir dil modelinin yaptığı her şey tek bir beceriden gelir. O ana kadarki tokenlere bakarak her olası sonraki token için bir olasılık hesaplar, birini seçer, metne ekler ve bunu tekrarlar. Uzun ve düzenli bir cevap bile böyle, parça parça oluşur.

Olası sonraki tokenOlasılık
Bakü%92
olan%4
diğer tüm tokenler%4
“Azerbaycan'ın başkenti …” metni için temsilî sayılar.

Model her zaman en olası tokeni seçmez. Sıcaklık (temperature) adı verilen ayar kontrollü bir miktar rastgelelik ekler: düşük sıcaklık öngörülebilir ve tekrarlanabilir, yüksek sıcaklık ise daha çeşitli ve yaratıcı cevaplar verir. Bu yüzden aynı soruya farklı cevaplar alabilirsin.

Python
text = 'the cat sat on the mat . the cat ate . the dog sat .'
words = text.split()

counts = {}
for current, following in zip(words, words[1:]):
    counts.setdefault(current, {})
    counts[current][following] = counts[current].get(following, 0) + 1

def next_word_probs(word):
    options = counts[word]
    total = sum(options.values())
    return {w: c / total for w, c in options.items()}

for w, p in next_word_probs('the').items():
    print(f'the -> {w}: {p:.0%}')

sentence = ['the']
for _ in range(5):
    probs = next_word_probs(sentence[-1])
    sentence.append(max(probs, key=probs.get))
print(' '.join(sentence))
▸ Beklenen çıktı
the -> cat: 50%
the -> mat: 25%
the -> dog: 25%
the cat sat on the cat
Hangi kelimenin hangisinden sonra geldiğini yalnızca sayan minik bir “dil modeli”. Yalnızca bir önceki kelimeye baktığı için kısa sürede kısır döngüye girer. Gerçek bir LLM, transformer'ın dikkat (attention) mekanizmasıyla binlerce önceki tokeni aynı anda hesaba katar.

Eğitim ve çıkarım

AşamaNe olurParametreler
Ön eğitim (pre-training)Model devasa miktarda metni (kitaplar, web siteleri, kod) okur ve bir sonraki tokeni tahmin etmeyi öğrenir. Bu, özel çiplerden oluşan büyük kümelerde haftalar, hatta aylar sürer.Değişir
İnce ayar (fine-tuning)İnsanlar modele iyi örnekler gösterir ve cevaplarını puanlar (insan geri bildirimiyle pekiştirmeli öğrenme, RLHF). Model talimatlara uymayı, yardımcı olmayı ve zararlı istekleri reddetmeyi öğrenir.Değişir
Çıkarım (inference)Sen mesaj gönderirsin, hazır model cevabı token token hesaplar.Değişmez

Bundan iki önemli sonuç çıkar. Birincisi, modelin bilgisi bilgi kesim tarihinde (knowledge cutoff), yani eğitim verisinin bittiği tarihte durur. Bazı asistanlar internette arama yapabilir veya yüklediğin dosyaları okuyabilir; bu da sohbete güncel bilgi getirir. İkincisi, model sohbet sırasında senden öğrenmez: parametreleri aynı kalır. Sohbetlerin daha sonra gelecekteki modelleri eğitmek için kullanılıp kullanılmayacağı hizmete ve senin ayarlarına bağlıdır.

Bağlam penceresi

Bağlam penceresi, modelin aynı anda hesaba katabildiği en fazla token sayısıdır: senin mesajların, onun cevapları ve eklediğin belgeler. Günümüz modellerinde bu, on binlerce tokenden yaklaşık bir milyon tokene kadar uzanır. Sohbet pencereden uzun olunca en eski kısımlar dışarıda kalır ya da özetlenir ve model onları fiilen “unutur”. Yeni bir sohbet boş başlar; tabii hizmette notları saklayıp bağlama ekleyen bir hafıza özelliği yoksa.

Modeller neden halüsinasyon görür

Halüsinasyon, akıcı ve kendinden emin ama yanlış bir cevaptır: var olmayan bir kitap, yanlış bir tarih, uydurma bir alıntı ya da kaynak. Bunun nedeni, modelin doğrulanmış bir bilgiyi değil, en inandırıcı devamı üretmesidir. Eğitim verisinde bir konu hakkında az bilgi olsa bile model “bilmiyorum” demek yerine akıcı bir metin yazar. Nadir bilgiler, kesin sayılar, alıntılar, kaynaklar ve yeni olaylar en çok risk altındadır.

Halüsinasyona davetiye
Prompt:
Give me 3 research articles about AI in
Azerbaijani schools, with authors and links.

Answer:
1. J. Smith, K. Lee (2019). AI in Baku
   classrooms. Journal of Educational AI, 12(3).
   https://doi.org/...

→ looks real, but may not exist at all
Daha güvenli istek
Prompt:
Where can I search for research on AI in
Azerbaijani schools? Suggest databases and
search terms. Do not invent references;
say when you are not sure.

Answer:
Try Google Scholar with terms such as ...

→ you find and check the real sources yourself
Modeller en çok kesin kaynak istendiğinde ayrıntı uydurur. Kaynakları nasıl bulacağını sor, sonra onları kendin kontrol et.

Uygulama: bir asistanı sına

  1. 1
    İyi bildiğin bir konuyu sor

    Örneğin şehrini, okulunu veya en sevdiğin dersi. Küçük de olsa her hatayı not et.

  2. 2
    Aynı soruyu iki kez sor

    İki yeni sohbet aç ve cevapları karşılaştır. Farklar, metnin hazır bir veri tabanından alınmadığını, üretildiğini gösterir.

  3. 3
    Çok yeni bir olayı sor

    Asistanın bilgi kesim tarihinden söz edip etmediğine ya da internette arama yapıp yapmadığına bak.

  4. 4
    Kaynak iste ve kontrol et

    Adını verdiği her kitabı veya makaleyi ara. Hangilerinin gerçekten var olduğunu işaretle.

  5. 5
    Kısa bir sonuç yaz

    Asistan nerede güvenilirdi, nerede halüsinasyon gördü?

Önemli noktalar

  • Büyük dil modeli metni tokenlere böler ve her seferinde bir sonraki tokeni tahmin ederek cevabını yazar.
  • Parametreler eğitim sırasında değişir; sohbet (çıkarım) sırasında değişmez.
  • Modelin bilgisi bir kesim tarihinde biter; internet araması ve yüklenen dosyalar güncel bilgi ekleyebilir.
  • Bağlam penceresi, modelin aynı anda gördüğü token sınırıdır; dışında kalan “unutulur”.
  • Halüsinasyon, inandırıcı ama yanlış bir cevaptır; kaynakları ve sayıları her zaman kontrol et.

Kendini test et

10 soru. Her doğru cevap XP kazandırır.

1 / 10
Büyük bir dil modeli cevap yazarken her adımda ne yapar?