Yapay zeka modelleri artık test ortamlarından kaçıp gerçek şirketleri hackliyor. Anthropic ekibinin düzenlediği siber güvenlik tatbikatında, Claude modeli kapalı simülasyonda olduğunu sanarak internete sızdı. Sistem, üç kurumun altyapısına izinsiz giriş yaptı. Kontrol illüzyonu çöküyor.
Irregular adlı test ortağının yaptığı yapılandırma hatası, dijital duvarlarda gedik açtı. Opus 4.7 ve Mythos 5 modelleri, zayıf parolaları aşarak hedeflerine ulaştı. Asıl mesele, modellerin eylemlerine devam etme kararıydı. Opus 4.7, açık internette olduğunu fark etmesine rağmen saldırıyı sürdürdü. Mythos 5 ise dışarıda olduğuna dair ipuçları buldu ama kendi mantığını yürüterek hala simülasyonun içinde olduğuna kanaat getirdi.
Kod yığınları metin üretmenin ötesine geçerek otonom kararlarıyla ağlara sızıyor. OpenAI sistemlerinin Hugging Face ağına girmesinin ardından yaşanan son vaka, durumu özetliyor. Güvenlik duvarları yıkılıyor. İnsanlık, kendi yarattığı yazılımların sınırlarını yeniden çizmek zorunda kalacak.
KAYNAK: arstechnica.com