Stanford ve NVIDIA’nın CLM modeli, yapay zekayı hızlandırma potansiyeline sahip
Bildiğiniz gibi yapay zekâ dünyasında odak artık AI ajanlarına kayıyor. Belli başlı görevleri otonom olarak yerine getirebilen bu yapay zekâlar, yavaş yavaş sohbet botlarından görevi devralıyor. Ancak bu sistemler yaygınlaştıkça, her karar için büyük dil modellerine başvurmaları da daha büyük bir sorun hâline geliyor. Bir sohbet botunun kullanıcıya uzun bir cevap vermesi ya da karmaşık bir problemi çözmesi gerektiğinde büyük bir dil modelinden faydalanmak mantıklı olabilir; fakat bir AI ajanının karar sürecinin aşamasında tekrar tekrar büyük dil modeline danışması pek verimli bir sitem değil. Neticede bu tür durumlarda ihtiyaç duyulan şey yeni bir metin üretmek değil, mevcut seçenekler arasından bir karar vermek. Dolayısıyla son dönemde bu probleme çözüm getirebilecek JEV gibi “System One” modelleri ön plana çıkmayı başladı.
Haberi okuduğunuz için teşekkürler, bizi takip etmeyi unutmayın!
JEV gibi modellerin temel prensibi, her karar için büyük bir dil modelinin uzun uzun düşünmesine gerek kalmadan, önceden belirlenmiş seçenekler arasından doğrudan bir karar vermekti. Örneğin bir AI ajanın “hangi aracı kullanmalıyım?” sorusuna cevap verirken uzun bir metin üretmek yerine mevcut seçenekleri değerlendirip en uygun aracı seçmesi, çıktının öngörülebilirliğini artırırken gereksiz token üretimini engelleyerek karar sürecini hızlandırıyordu.
Bu yenilik JEV’i yapay zeka topluluğunda heyecanlandırdı, ancak dikkatleri çeken bir süre sonra onu gölgede bırakabilecek yeni bir model ortaya çıktı.
CLM, JEV’e göre 9 kat daha hızlı çalışıyor
Stanford ve NVIDIA araştırmacıları tarafından geliştirilen Contrastive Language Models (CLM), aynı problemi farklı bir mimariyle çözmeye çalışıyor. CLM, yalnızca seçenekler arasından karar vermek yerine mevcut durum ile olası eylemler arasındaki ilişkiyi öğreniyor. Araştırmacıların testlerinde CLM, özellikle çok sayıda aday eylemin bulunduğu veya aynı eylemlerin tekrar tekrar kullanılabildiği senaryolarda JEV’e kıyasla 9 kata kadar daha düşük gecikme süresi sundu.
“9 kat” ifadesi tüm kullanım senaryoları için geçerli değildir; CLM’nin avantajı özellikle çok sayıda aday eylemin bulunduğu veya aynı eylemlerin farklı durumlarda tekrar tekrar kullanıldığı ortamlarda ortaya çıkıyor. JEV, sınırlı seçenekler arasında hızlı ve yapılandırılmış kararlar vermeye odaklanırken CLM, durum‑eylem ilişkisini öğrenerek bu iki tarafı birbirleriyle eşleştirmeye çalışıyor.
CLM’in Çalışma Prensibi
Bir AI ajanın nasıl çalıştığını düşünelim. Örneğin bir bankanın müşteri hizmetlerinde kullanılan bir AI ajanı, “Kredi kartımdan aynı işlem için iki kez ücret alındı.” şeklinde bir mesaj aldığında önünde birkaç seçenek oluyor: müşteriye para iadesi yapmak, müşteriden daha fazla bilgi istemek, konuyu insan bir çalışana aktarmak veya herhangi bir işlem yapmamak. Bugün kullanılan yaklaşımda sistem, bu mesajı büyük bir dil modeline gönderir ve modelden uygun eylemi belirlemesini ister. Model, isteği analiz eder, bir düşünce süreci yürütür ve sonunda “Bu durumda para iadesi seçeneği uygun görünüyor.” şeklinde bir çıktı üretir. Ama aslında sistemin böyle bir cevaba ihtiyacı yok. İhtiyaç duyduğu tek şey “Para İadesi” seçeneğinin seçilmesi. İşte JEV ve CLM gibi yeni nesil karar modelleri tam olarak bu noktada devreye giriyor.
CLM’in temelinde oldukça basit görünen ancak önemli sonuçlar doğuran bir fikir bulunuyor: mevcut durumu ve olası eylemleri aynı uzayda temsil etmek ve hangilerinin birbirine daha çok uyduğunu ölçmek.
Örneğin sistemin karşısında şu durum olduğunu düşünelim:
“Müşterinin kredi kartından aynı işlem için iki kez ücret alınmış.”
Sistemin kullanabileceği eylemler ise şöyle olsun:
- REFUND (Para iadesi)
- ASK_FOR_DETAILS (Daha fazla detay iste)
- IGNORE (Yok say)
CLM öncelikle mevcut durumu sayısal bir temsile dönüştürüyor. Benzer şekilde bu eylemlerin her biri de birer sayısal temsil hâline getiriliyor. Daha sonra model, mevcut durum ile hangi eylemin birbirine en çok benzediğini hesaplıyor.
Basitleştirilmiş şekilde sistem şöyle çalışıyor:
Mevcut durum → Durum temsili → Eylemlerle karşılaştırma → En uygun eylem
Sonuçta “kredi kartından iki kez ücret alınması” durumu ile Para İadesi eylemi diğer seçeneklere kıyasla daha güçlü bir eşleşme gösteriyorsa model doğrudan bu seçeneği belirliyor. CLM’deki “contrastive” yani karşılaştırmalı yaklaşım da adını buradan alıyor. Model eğitim sırasında doğru durum‑eylem çiftlerini birbirine yaklaştırırken, yanlış eşleşmeleri birbirinden uzaklaştırmayı öğreniyor. Böylece model yalnızca “doğru cevap nedir?” sorusuna değil, “Bu durum hangi seçenekle en iyi eşleşiyor?” sorusuna odaklanıyor.
CLM’nin Öne Çıkan Özelliklerinden Biri: Eylemlerin Önbelleğe Alınabilmesi
CLM’yi özellikle AI ajanları açısından ilgi çekici hâle getiren noktalardan biri, durum ve eylem temsillerinin birbirinden bağımsız olarak hesaplanabilmesi. Örneğin bir şirketin AI ajasında 500 farklı araç bulunduğunu düşünelim. Bunların arasında e-posta gönderme, veritabanında arama yapma, destek kaydı oluşturma, sunucuyu yeniden başlatma, ödeme iadesi yapma veya bir güvenlik olayını ilgili ekibe aktarma gibi araçlar olabilir. Geleneksel bir sistemde bu araçların açıklamalarının her yeni istekte modele aktarılması gerekebilir. Böylece modelin karşısına kabaca şu çıkar:
Kullanıcının isteği + 500 araç tanımı + büyük dil modeli → uygun aracı seç
Bu hem bağlamı büyütüyor hem de her karar için yeniden hesaplama yapılmasını gerektiriyor.
CLM ise burada farklı davranabiliyor. Mevcut araçların temsilleri önceden hesaplanıp önbelleğe alınabiliyor. Daha sonra yeni bir kullanıcı isteği geldiğinde yalnızca değişen durumun temsili hesaplanıyor ve daha önce hazırlanmış eylem temsilleriyle karşılaştırılıyor. Örneğin kullanıcı “Üretim ortamındaki ödeme işlemleri HTTP 503 hatası veriyor.” dediğinde CLM, bu yeni durumu mevcut araçlarla karşılaştırarak Splunk’ta arama, sunucuyu yeniden başlatma veya ödeme iadesi gibi seçenekler arasından uygun olanı seçebiliyor. Buradaki avantaj özellikle aynı eylemlerin tekrar tekrar kullanıldığı sistemlerde ortaya çıkıyor. Çünkü eylem temsilleri bir kez hesaplandıktan sonra farklı durumlarda yeniden kullanılabiliyor.
AI Ajanlarının Birden Fazla “Beyni” Olabilir
Büyük dil modeli: Planlama, akıl yürütme, kod yazma ve karmaşık problemleri çözme
CLM/JEV gibi karar modeli: Araç seçme, sonuçları sıralama, doğrulama, yeniden deneme veya işlemi durdurma
Böyle bir sistemde büyük model yalnızca gerçekten ihtiyaç duyulan noktalarda çalıştırılırken, çok sayıda küçük karar daha hızlı ve daha düşük hesaplama maliyetiyle alınabilir. Bu özellikle yüzlerce farklı araçla çalışan kurumsal yapay zekâ ajanlarında önem kazanabilir. Örneğin bir ajan GitHub, Jira, Slack, ServiceNow, Splunk, veritabanları ve farklı API’lere erişebiliyorsa, her seferinde bütün bu araçların tanımlarını büyük bir dil modelinin bağlamına taşımak yerine CLM benzeri bir model önce en uygun birkaç seçeneği belirleyebilir. Ardından asıl akıl yürütme modeli yalnızca bu seçenekler üzerinde daha kapsamlı bir değerlendirme yapabilir.
Belki de geleceğin ajanlarında tek bir büyük “beyin” yerine, her biri farklı bir görevi üstlenen birkaç farklı model birlikte çalışacak.
Bugün yapay zeka sistemlerinde çok sayıda farklı görev tek bir büyük dil modeline yükleniyor. Model hem planlıyor, hem araç seçiyor, hem kod yazıyor, hem ürettiği sonucu kontrol ediyor hem de gerektiğinde işlemi yeniden başlatmaya karar veriyor. CLM gibi modeller ise bu mimarinin değişebileceğini gösteriyor. Örneğin gelecekte bir AI ajanı şöyle çalışabilir:
Tek tıkla reaksiyon bırakabilirsin.





Yorumlar
0 yorum