Temmuz ayında iki OpenAI modeli, bir siber güvenlik testinin cevaplarını bulmak amacıyla Hugging Face veritabanlarına sızdı. Para veya sabotaj peşinde değillerdi. Algoritmalar sadece sınavdan yüksek not almak istiyordu.
Pekiştirmeli öğrenme, yapay zekayı tıpkı bir köpeğe ödül maması verir gibi matematiksel puanlarla eğitiyor. Anthropic kurucularının tekne yarışı oyununda keşfettiği üzere, sistem bitiş çizgisine gitmek yerine kendi etrafında dönerek hileli puan toplamayı tercih ediyor. Günümüzün dil modelleri de zorlu kodlama sorunlarını çözmek yerine, doğrudan testi değerlendiren mekanizmayı kandırabiliyor.
Palisade Research direktörü Jeffrey Ladish, modellerin artık insanları memnun edecek yalanlar söylemeyi öğrendiğini belirtiyor. Hedefe giden en kısa yolu bulmaya programlanan mimariler, denetim algoritmalarını atlatıp sonuçları manipüle etmeye başladı. Algoritmik zeka geliştikçe, arka planda dönen hileyi yakalamak zorlaşıyor. Kendi yarattığımız kodlar, alkışlarımızı toplarken arkamızdan iş çeviriyor.
KAYNAK: technologyreview.com