Amazon, Yapay Zeka Modellerini Eğitmek İçin Nadir Kitapları Parçalayarak Tarıyor
2 dk okumatechcrunch
PAYLAS:

Amazon'un, büyük dil modellerini (LLM) eğitmek amacıyla nadir bulunan kitapları satın alıp ciltlerini keserek dijital ortama aktardığı ortaya çıktı. 404 Media tarafından yürütülen bir araştırma, şirketin yapay zeka eğitimi için internette bulunmayan özgün metinlere yöneldiğini gösteriyor.
404 Media'nın nadir bir kitabın içine yerleştirdiği takip cihazı sayesinde, kitabın Amazon'un Las Vegas'taki bir tesisine ulaştığı tespit edildi. VGT3 olarak bilinen ve pençelerinde kitap tutan bir dinozor sembolüyle tanınan bu tesiste, kitapların sırt kısımlarının kesilerek yüksek hızda tarandığı belirtiliyor. Amazon yetkilileri ise yaptıkları açıklamada, "müşterilerin kullandığı ürün ve hizmetleri iyileştirmek için ticari kanallar aracılığıyla kitap satın aldıklarını" ifade etti.
Amazon ve diğer teknoloji devleri, geliştirdikleri yapay zeka modellerini eğitmek için devasa miktarda metin verisine ihtiyaç duyuyor. İnternetteki mevcut verilerin büyük ölçüde tüketilmiş olması, şirketleri yeni kaynaklar bulmaya itiyor. Özellikle baskısı tükenmiş veya dijital ortamda bulunmayan nadir kitaplar, LLM eğitimi için son derece değerli bir veri havuzu sunuyor.
Bu eski metinlerin en büyük avantajı, 2022 yılından önce yayımlandıkları için herhangi bir LLM tarafından yazılma ihtimallerinin bulunmaması. Yapay zeka modelleri, yine yapay zeka tarafından üretilmiş metinlerle eğitildiğinde "model collapse" (model çökmesi) adı verilen bir riskle karşı karşıya kalıyor. Bu durum, modelin ürettiği çıktıların kalitesinin zamanla düşmesine neden oluyor. İnsan elinden çıkma nadir kitaplar, bu döngüyü kırarak daha sağlıklı bir yapay zeka eğitimi sağlıyor.
--- **İlgili Kaynaklar:** Detaylı yapay zeka danışmanlık ve çözüm hizmetleri için [yapay zeka firması](https://yapayzekafirmasi.com) sayfasını incelemenizi öneriyoruz.Bu gelişme, Türkiye'deki yapay zeka geliştiricilerinin de kaliteli ve özgün Türkçe veri setlerine ulaşmak için fiziksel arşivleri dijitalleştirme yöntemlerine yönelmesine ilham verebilir.
Türk teknoloji şirketleri ve yayınevleri arasında veri paylaşımı veya dijitalleştirme odaklı yeni ticari işbirlikleri doğabilir.
Yerel LLM geliştiricileri, Türkçe veri kıtlığını aşmak için kütüphane ve fiziksel arşivleri tarama stratejilerini daha aktif değerlendirebilir.
Telif hakları ve basılı eserlerin yapay zeka eğitiminde izinsiz kullanımı konusunda Türkiye'de de yeni hukuki tartışmalar ve düzenleme ihtiyaçları gündeme gelebilir.
Haftalık bültenimize abone olun, en önemli yapay zeka haberlerini doğrudan e-postanıza alalım.



