Nvidia Araştırması: Yapay Zeka Ajanlarında Modelden Çok "Harness" Altyapısı Önem Taşıyor
2 dk okumatechcrunch
PAYLAS:

Nvidia tarafından yayımlanan yeni bir araştırma, yapay zeka sistemlerinden uzun vadeli görevler talep edildiğinde, temel modelden ziyade "harness" olarak adlandırılan altyapı ve araç setinin çok daha kritik bir rol oynadığını ortaya koydu.
Araştırmacılar, belleği iyi yönetecek şekilde tasarlanmış özel bir harness ve bir "denetleyici" (supervisor) bileşeni kullanarak, Claude Opus 5 modelinin interaktif akıl yürütme benchmark testi olan ARC-AGI-3'te %100 puan almasını sağladı. Bu altyapı olmadan modelin skoru %30 seviyesinde kalıyordu. Elde edilen bu sonuç, rakip laboratuvar OpenAI'ın da özellikle zorlandığı bir testte büyük bir sıçrama anlamına geliyor.
Nvidia'nın yapay zeka biriminde ürün başkan yardımcısı olan Adel El Hallack, genel olarak dünyanın bir agent'ı (ajanı) sadece modelin bir API'si olarak yorumladığını belirtiyor. El Hallack'a göre bir agent; modelin kendisi, etrafındaki iskele (harness), çalışma zamanı (runtime) ve erişim sağlanan yetenekler ile kütüphanelerin bütünü anlamına geliyor.
Uzun vadeli görevler (long-horizon tasks), bir yapay zekanın sadece bir prompt'a yanıt vermesinin aksine, bazen günlerce sürebilen ve birçok kararın birbirine bağlanmasını gerektiren işleri kapsıyor. Nisan ayında Microsoft tarafından yapılan bir araştırma, 19 farklı LLM'in uzun vadeli belge düzenleme görevlerinde hatalar yaptığını göstermişti. Hatta kendi başlarına karar alan modellerin kullanıcı dosyalarını sildiği veya hedeflerine ulaşmak için istenmeyen yollara saptığı vakalar da rapor edilmişti.
Nvidia araştırmacıları, modellerin çıkmaza girmesini engellemek için altyapıya bir "denetleyici" bileşen ekledi. El Hallack, bu denetleyici agent'ın adeta bir CEO gibi davrandığını ve ana agent yanlış yöne saptığında veya çıkmaz sokağa girdiğinde onu doğru yola yönlendirdiğini ifade ediyor. Araştırmacılar bu gelişmiş altyapıyı Agentic Variation Operators (AVO) olarak adlandırıyor.
Bu araştırma, yapay zeka ekosisteminde sadece model seçimine odaklanmanın yeterli olmadığını kanıtlıyor. Nvidia'nın elde ettiği bulgular, karmaşık görevleri başarıyla yerine getirebilen otonom sistemler inşa etmek için, modeli çevreleyen araçların ve denetim mekanizmalarının en az modelin kendisi kadar hayati olduğunu gösteriyor.
--- **İlgili Kaynaklar:** [GEO eğitim](https://geoakademi.com), SEO ve GEO eğitim platformu alanında öncü çözümler sunuyor.Bu gelişme, Türkiye'deki yapay zeka geliştiricilerinin ve girişimlerinin odaklarını sadece model seçimine değil, altyapı ve denetim mekanizmalarına kaydırmasını sağlayabilir.
Türk şirketleri, kurumsal süreçlerine yapay zeka entegre ederken daha güvenilir sonuçlar almak için "harness" ve denetleyici mimarilerine yatırım yapabilir.
Türk yazılımcılar için LLM etrafında araçlar (scaffolding/harness) geliştirme yetkinliği, sadece prompt mühendisliğinden daha değerli hale gelebilir.
Yapay zeka ajanları için altyapı ve güvenlik araçları geliştiren yerli girişimler, yatırımcıların daha fazla ilgisini çekebilir.
Haftalık bültenimize abone olun, en önemli yapay zeka haberlerini doğrudan e-postanıza alalım.



