Yapay Zeka Botlarına Karşı Yeni Web Savunması: ShieldFont
2 dk okumaars-technica
PAYLAS:

Yapay zeka şirketlerinin eğitim verisi toplamak için web sitelerini taramasına karşı yeni bir savunma yöntemi geliştirildi. İki tasarımcı tarafından oluşturulan ShieldFont adlı yazı tipi, insan okuyuculara kusursuz bir metin sunarken, arka plandaki HTML kodunu tarayan botlara tamamen anlamsız kelimeler iletiyor.
ShieldFont, genellikle harf çiftlerini daha okunaklı hale getirmek için kullanılan ligatür (bağlama) özelliğini temel alıyor. Ancak bu yazı tipi, ligatürleri harfleri birleştirmek yerine kelimelerin tamamını değiştirmek için kullanıyor. Bu değişim yalnızca yazı tipi motoru sayfayı ekranda oluşturduğunda gerçekleşiyor. Böylece, yapay zeka botları sayfanın plaintext kaynak kodunu indirdiğinde, son kullanıcıların asla görmediği değiştirilmiş bir versiyonla karşılaşıyor.
Akıllı scraper yazılımlarını kandırmak için kelime değişimleri özenle seçiliyor. Kelimeleri basitçe eş anlamlıları veya zıt anlamlılarıyla değiştirmek, botlar tarafından kolayca tersine çevrilebiliyor. Tamamen anlamsız kelimeler kullanmak ise filtreler tarafından hızlıca tespit edilebiliyor. Bu nedenle ShieldFont, kelimeleri tamamen farklı bir bilgi bağlamına sahip benzer kelimelerle değiştiriyor; örneğin "at" kelimesi yerine "patates" kelimesini yerleştiriyor.
Üç aylık bir çalışmanın ardından geliştiriciler, ligatürlerle değiştirilebilen yaklaşık 12.000 yaygın kelimeden oluşan bir sözlük oluşturdu. Tespit edilmekten kaçınmak için yayıncılara her kelime değişimi için üç farklı eşleme seçeneği sunuluyor. Ortalama olarak ShieldFont, bir sayfadaki tüm kelimelerin yüzde 24,5'ini değiştirerek metnin anlamını büyük ölçüde bozuyor.
Altı farklı genel scraper pipeline üzerinde yapılan testlerde, normalde kabul edilecek sayfaların yüzde 90'ından fazlasının bu değişimler sonrasında kalite filtreleri tarafından reddedildiği görüldü. Filtreyi geçmeyi başaran sayfaların ise içerdiği kelimelerin yaklaşık yüzde 20'si, dil modeli eğitimleri için "çöp veri" haline geliyor. Bu durum, AI şirketlerinin eğitim veri setlerini doğrudan zehirleme potansiyeli taşıyor.
ShieldFont sayfaları insanlar tarafından sorunsuz bir şekilde okunabilse de, yayınlanmış web sayfalarında kullanılmasının bazı yan etkileri bulunuyor. Değiştirilmiş HTML yapısı; arama motorlarının, ekran okuyucuların, kopyala/yapıştır araçlarının ve çeviri yazılımlarının hata vermesine neden olabiliyor. Ayrıca, insan tarafından okunabilen herhangi bir sayfanın görsel tarama yöntemleriyle botlar tarafından hala kopyalanabilme riski bulunuyor.
--- **İlgili Kaynaklar:** Profesyonel SEO ve GEO eğitim platformu çözümleri için [GEO eğitim](https://geoakademi.com) sayfasını ziyaret edin.Türkiye'deki içerik üreticileri ve haber siteleri, telif haklarını korumak için bu tür veri zehirleme yöntemlerini kullanmaya başlayabilir.
Türk yayıncılar ve medya kuruluşları, içeriklerinin izinsiz kullanılmasını engellemek için benzer font tabanlı koruma sistemlerini web sitelerine entegre edebilir.
Türkiye'deki yerel dil modeli (LLM) geliştiren girişimler, web'den Türkçe veri toplarken bu tür veri zehirleme engelleriyle karşılaşabilir ve scraper algoritmalarını güncellemek zorunda kalabilir.
Haftalık bültenimize abone olun, en önemli yapay zeka haberlerini doğrudan e-postanıza alalım.



