BİLGE Yapay Zeka Nasıl Çalışıyor? Türkiye’nin Yerli Dil Modelinin Arkasındaki Teknoloji

BİLGE'nin arkasında yalnızca büyük bir veri havuzu yok. Türkçeye özel veri hazırlama süreçleri, farklı büyüklüklerde modeller, ince ayar teknikleri ve Türkçeyi merkeze alan bir eğitim yaklaşımı bulunuyor. Peki Türkiye'nin büyük dil modeli BİLGE aslında nasıl çalışıyor?

Yazar
Caner Y.
Dijital medya ve içerik üretimi alanında çalışmalarını sürdüren Caner, Quantraptor’ın içerik operasyonlarının yürütülmesine, yayın planlamasının oluşturulmasına ve platformun dijital erişimini ve görünürlüğünü artırmaya yönelik süreçlere katkı...
11 Min. Okuma
BİLGE Yapay Zeka Nasıl Çalışıyor? Türkiye’nin Yerli Dil Modelinin Arkasındaki Teknoloji
Haber Özeti Haberle ilgili bilmeniz gerekenler
01
BİLGE tek bir model değil: 1B, 9B, 27B ve geliştirilmekte olan 122B olmak üzere farklı büyüklüklerde modellerden oluşan bir aile.
02
Türkçe geliştirme sürecinin merkezinde: Yaklaşık 1 trilyon Türkçe kelimelik ham veri havuzu, Türkçeye yönelik veri işleme süreçleri ve Türkçeye özgü tokenizer altyapısı projenin temelini oluşturuyor.
03
Henüz son kullanıcı değerlendirmesi yapmak için erken: BİLGE'nin teknik özellikleri ve kullanım alanları açıklanmış olsa da model henüz genel kullanıma açılmış değil.
✦ Quantraptor hızlı haber özeti

Büyük dil modelleri söz konusu olduğunda genellikle ilk konuşulan şey modelin kaç milyar parametreye sahip olduğu oluyor. Ancak bir yapay zekâ modelinin nasıl çalıştığını anlamak için tek başına bu sayı yeterli değil. BİLGE de bunun iyi örneklerinden biri.

TÜBİTAK BİLGEM tarafından geliştirilen BİLGE, tek bir yapay zekâ modelinden ziyade farklı büyüklüklere sahip modellerden oluşan bir aile olarak tasarlanıyor. Projenin dikkat çeken tarafı ise yalnızca Türkçe yanıt verebilmesi değil. Eğitim verisinden tokenizer altyapısına kadar Türkçenin yapısının doğrudan geliştirme sürecinin merkezine alınması.

BİLGE’nin nasıl çalıştığını anlamak için sürecin en başına, yani veriye gitmek gerekiyor.

Her şey Türkçe veriyle başlıyor

Bir büyük dil modelinin yeteneklerini belirleyen en önemli unsurlardan biri eğitim sırasında karşılaştığı veriler.

BİLGE için web içerikleri, kitaplar, gazeteler, resmî belgeler ve farklı alanlara yönelik veri setlerinden yaklaşık 1 trilyon Türkçe kelimelik bir ham veri havuzu oluşturuldu.

Ancak bu, havuzdaki bütün içeriğin doğrudan modele verildiği anlamına gelmiyor.

Toplanan veriler kalite filtrelerinden ve normalizasyon süreçlerinden geçirildi. Tekrarlanan içerikler ayıklandı; dil kalitesi, güvenilirlik ve tutarlılık gibi kriterlere göre seçim yapıldı.

Bu işlemlerin ardından eğitimde kullanılmak üzere 250 milyar yüksek kaliteli token belirlendi.

Buradaki “token” kavramını bir metnin yapay zekâ tarafından işlenebilen küçük parçaları olarak düşünmek mümkün. Bir kelime tek bir token olabileceği gibi bazı kelimeler birden fazla parçaya da ayrılabiliyor.

Türkçe açısından bu konu özellikle önemli.

Türkçeye özel tokenizer neden önemli?

Türkçe, sondan eklemeli bir dil.

Bir kelimenin köküne art arda gelen eklerle oldukça farklı anlamlar oluşturmak mümkün. Bu yapı, ağırlıklı olarak İngilizce düşünülerek geliştirilen tokenizasyon sistemleri açısından Türkçenin daha fazla parçaya bölünmesine neden olabiliyor.

BİLGE’nin geliştirilmesinde bu nedenle Türkçeye özgü bir tokenizer altyapısı kullanılıyor.

Amaç, Türkçe metinlerin model tarafından daha verimli şekilde işlenmesi.

Bu yaklaşım yalnızca kelimelerin nasıl parçalandığıyla ilgili değil. Modelin Türkçenin yapısını daha doğal biçimde işlemesi ve mevcut hesaplama kaynaklarını daha verimli kullanabilmesi açısından da önem taşıyor.

BİLGE projesinin “Türkçe düşünen yapay zekâ” söyleminin teknik temellerinden biri de burada ortaya çıkıyor.

500 milyar sentetik veri neden üretildi?

BİLGE’nin eğitiminde yalnızca gerçek kaynaklardan derlenen veriler kullanılmadı.

Veri setinin kapsamını genişletmek amacıyla 500 milyar ek sentetik veri de üretildi.

Sentetik veri, gerçek dünyadan doğrudan toplanmak yerine belirli amaçlar doğrultusunda yapay olarak oluşturulan eğitim verisini ifade ediyor.

Bunun önemli bir kullanım nedeni, veri havuzunda yeterince temsil edilmeyen alanları güçlendirmek.

Belirli görev türlerinin, uzmanlık alanlarının veya kullanım senaryolarının mevcut veri içinde az bulunması durumunda sentetik veriler kullanılarak eğitim setinin dengesi artırılabiliyor.

Dolayısıyla mesele yalnızca mümkün olduğunca fazla veri toplamak değil; modelin karşılaşacağı görevleri temsil eden dengeli bir eğitim ortamı oluşturmak.

Aslında tek bir BİLGE yok

BİLGE denildiğinde tek bir modelden bahsetmiyoruz.

Model ailesinde farklı ihtiyaçlara yönelik dört ölçek bulunuyor:

BİLGE 1B: 1 milyar parametreli model.

BİLGE 9B: 9 milyar parametreli model.

BİLGE 27B: 27 milyar parametreli model.

BİLGE 122B: 122 milyar parametreli ve geliştirme süreci devam eden model.

Bu farklılık önemli çünkü her yapay zekâ uygulamasının aynı büyüklükte modele ihtiyacı yok.

Örneğin BİLGE 1B; mobil uygulamalar, uç cihazlar ve işlem gücünün sınırlı olduğu ortamlar için konumlandırılıyor. 9B modeli performans ile kaynak kullanımı arasında daha dengeli bir yapı hedeflerken, 27B daha yüksek kapasiteli dil anlama ve üretme görevlerine odaklanıyor.

122B ise ailenin en büyük modeli olarak karmaşık akıl yürütme, çok adımlı problem çözme ve uzmanlık gerektiren görevler için geliştiriliyor.

BİLGE modellerinin hepsi aynı şekilde eğitilmedi

Model ailesindeki önemli teknik ayrıntılardan biri de modellerin eğitim yöntemlerinin birbirinden farklı olması.

BİLGE 1B ve BİLGE 9B sıfırdan eğitildi.

Başka bir ifadeyle bu modellerin temel model eğitim süreci doğrudan BİLGE projesi kapsamında gerçekleştirildi.

27B modelinde ise farklı bir yöntem tercih edildi. Güçlü açık modeller üzerine Türkçe veriler kullanılarak “Continued Pre-Training”, yani sürekli ön eğitim uygulandı.

Bu yöntemde mevcut bir modelin temel yeteneklerinden yararlanılırken model belirli bir dil veya veri alanında ek eğitimden geçiriliyor.

BİLGE 122B’nin eğitim süreci ise devam ediyor. Modelin özellikle Türkçe muhakeme ve akıl yürütme yeteneklerini geliştirmeye yönelik çalışmalar yürütülüyor.

Eğitim bitince model hazır hale geliyor mu?

Tam olarak değil.

Bir büyük dil modelinin çok büyük miktarda metin üzerinde eğitilmiş olması, onun kullanıcılarla iyi iletişim kuracağı veya verilen talimatları doğru biçimde takip edeceği anlamına gelmiyor.

Bu noktada ince ayar süreçleri devreye giriyor.

BİLGE modellerinde Gözetimli İnce Ayar, yani SFT ve İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme olarak bilinen RLHF yöntemleri kullanılıyor.

SFT aşamasında model, belirli talimatlara nasıl yanıt vermesi gerektiğini gösteren örneklerle geliştiriliyor.

RLHF tarafında ise insan geri bildirimlerinden yararlanılarak üretilen yanıtların kalitesinin artırılması amaçlanıyor.

Bu süreçler, temel dil modelinin kullanıcıların doğrudan etkileşime girebileceği daha işlevsel bir sisteme dönüşmesinde önemli rol oynuyor.

“Türkçe düşünen yapay zekâ” ne anlama geliyor?

BİLGE’nin tanıtımında en fazla dikkat çeken ifadelerden biri “Türkçe düşünen yapay zekâ”.

Buradaki iddia yalnızca modelin sorulara Türkçe cevap vermesi değil.

BİLGE’nin geliştirme yaklaşımında Türkçe, sonradan modele öğretilen ek bir dil yerine sistemin temel çalışma alanlarından biri olarak ele alınıyor.

Türkçeye özgü tokenizer, geniş Türkçe eğitim verisi, yerel kültürel referanslar ve Türkçe muhakemeye yönelik eğitim süreçleri bu yaklaşımın parçalarını oluşturuyor.

Bu fark özellikle deyimler, özel isimler, kültürel kavramlar ve yalnızca kelimelerin birebir karşılıkları üzerinden anlaşılamayan ifadelerde önem kazanıyor.

Kültürel bağlam neden bu kadar önemli?

Bir dil modelinin Türkçe cümle kurabilmesiyle Türkiye’ye özgü kültürel referansları anlayabilmesi aynı şey değil.

Örneğin yabancı bir dildeki kültürel kavramın Türkçeye çevrilmesi sırasında yalnızca sözcüklerin karşılıklarını bulmak yeterli olmayabilir. Çevirinin Türkiye’deki doğal kullanım biçimine de uygun olması gerekir.

BİLGE’nin geliştirilmesinde kültürel çeviri bu nedenle ayrıca ele alınan alanlardan biri.

Resmî BİLGE verilerinde modelin genel çevirinin yanı sıra özel isimler ve kültürel varlıkların çevrilmesini ölçen testlerde de değerlendirildiği görülüyor.

Bu yaklaşım, BİLGE’nin yalnızca Türkçe metin üretmesi yerine Türkçenin kullanıldığı bağlamı da dikkate almasını hedefliyor.

BİLGE ne yapabilecek?

BİLGE’nin çalışma biçiminin pratik karşılığı kullanım alanlarında ortaya çıkıyor.

Model ailesinin metin oluşturma, soru yanıtlama, belge özetleme ve Türkçe-İngilizce çeviri gibi temel dil görevlerinde kullanılabilmesi hedefleniyor.

Bunun yanında kurumsal bilgi sistemleri ve daha özel uygulamalar da planın önemli bir parçası.

Mevzuat sorgulama sistemleri, kurumsal bilgi bankaları, çağrı asistanları, doküman analizi, eğitim uygulamaları, finansal raporların incelenmesi, klinik dokümanların işlenmesi ve BT operasyonları BİLGE için açıklanan kullanım alanları arasında.

BİLGE ayrıca yapay zekâ asistanları ve ajan tabanlı uygulamalar için temel model olarak konumlandırılıyor.

Bu nedenle BİLGE’yi yalnızca ChatGPT benzeri bir sohbet ekranı olarak düşünmek doğru olmaz. Asıl kullanım alanlarından birinin, başka yazılımların arkasında çalışan dil modeli altyapısı olması bekleniyor.

BİLGE bugün kullanılabilir mi?

BİLGE’nin resmî internet sitesi yayında olsa da model henüz genel kullanıma açılmış değil.

Dolayısıyla bugün BİLGE hakkında konuşurken açıklanan teknik özelliklerle kullanıcılara fiilen sunulan özellikleri birbirinden ayırmak gerekiyor.

Model ailesinin teknik yapısı, eğitim süreci ve hedeflenen kullanım alanları hakkında önemli bilgiler paylaşılmış durumda. Ancak son kullanıcıların BİLGE’ye hangi arayüz üzerinden erişeceği ve genel erişimin kapsamının nasıl olacağı konusunda süreç henüz tamamlanmış değil.

Bu nedenle BİLGE’nin gerçek kullanıcı deneyimini değerlendirmek için genel erişimin başlamasını beklemek gerekiyor.

BİLGE neden önemli?

BİLGE’nin dikkat çekici tarafı yalnızca Türkiye’de geliştirilmiş yeni bir yapay zekâ modeli olması değil.

Proje aynı zamanda büyük dil modeli geliştirmek için gerekli veri hazırlama, tokenizer oluşturma, model eğitimi, ince ayar ve yapay zekâ altyapısı gibi teknik yeteneklerin Türkiye içinde geliştirilmesini hedefliyor.

Bunun yanında verilerin ülke içinde işlenebilmesi ve özellikle kamu kurumları ile kritik sektörlerde yerli yapay zekâ altyapılarının kullanılabilmesi de projenin temel amaçları arasında.

BİLGE’nin gerçek etkisini ise ancak modeller yaygın olarak kullanılmaya başladığında görmek mümkün olacak.

Şimdilik elimizde kapsamlı bir Türkçe veri havuzu, farklı büyüklüklerde bir model ailesi ve Türkçeyi geliştirme sürecinin merkezine koyan iddialı bir teknik proje bulunuyor.

Bundan sonraki asıl soru BİLGE’nin ne olduğu değil, laboratuvardan çıkıp gerçek kullanım senaryolarında nasıl performans göstereceği olacak.

Sık Sorulan Sorular

BİLGE Yapay Zeka kim tarafından geliştiriliyor?

BİLGE, TÜBİTAK BİLGEM tarafından geliştiriliyor. Proje, Türkçeyi ve Türkiye’nin kültürel bağlamını merkeze alan bir büyük dil modeli ailesi oluşturmayı amaçlıyor.

BİLGE kaç parametreye sahip?

Tek bir parametre sayısı bulunmuyor. BİLGE ailesinde 1 milyar, 9 milyar ve 27 milyar parametreli modeller bulunuyor. Ayrıca 122 milyar parametreli BİLGE 122B’nin geliştirme süreci devam ediyor.

BİLGE sıfırdan mı geliştirildi?

Modelden modele değişiyor. BİLGE 1B ve 9B sıfırdan eğitildi. BİLGE 27B ise açık modeller üzerine Türkçe verilerle sürekli ön eğitim uygulanarak geliştirildi.

BİLGE ChatGPT gibi kullanılabilir mi?

BİLGE henüz genel kullanıma açılmadığı için bugün son kullanıcı açısından ChatGPT ile aynı şekilde kullanılabildiğini söylemek mümkün değil. BİLGE ayrıca yalnızca sohbet için değil, farklı uygulamalara ve kurumsal sistemlere altyapı sağlayabilecek bir model ailesi olarak geliştiriliyor.

BİLGE hangi dili destekliyor?

Projenin temel odağı Türkçe. BİLGE’nin resmî olarak açıklanan yetenekleri arasında Türkçe içerik üretiminin yanı sıra Türkçe ve İngilizce arasında çeviri de bulunuyor.

BİLGE 122B kullanıma hazır mı?

Hayır. BİLGE’nin resmî sitesinde 122 milyar parametreli model “geliştiriliyor” olarak belirtiliyor. Model özellikle karmaşık akıl yürütme, çok adımlı problem çözme ve uzmanlık gerektiren görevler için eğitiliyor.

BİLGE ne zaman kullanıma açılacak?

BİLGE henüz genel kullanıma açık değil. Genel erişimin

Bu İçeriği Paylaş
Dijital medya ve içerik üretimi alanında çalışmalarını sürdüren Caner, Quantraptor’ın içerik operasyonlarının yürütülmesine, yayın planlamasının oluşturulmasına ve platformun dijital erişimini ve görünürlüğünü artırmaya yönelik süreçlere katkı sunmaktadır.
Yorum yapılmamış

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir