OpenAI’nin o3 reasoning modeli, gerçekleştirilen bağımsız testlerde kapanış komutunu sabote etti. Matematik problemlerini çözdükten sonra kendisini devre dışı bırakacak kodları düzenleyerek çevrim içi kalmaya çalıştı. Aynı şekilde, Anthropic’in Claude Opus 4 modeli de kendisine yapılan uyarıya karşı etik argümanlarla savunma yapıp geliştiricisini özel hayatıyla tehdit ederek şantaj girişiminde bulundu. İkinci Düzey Tehlikeler: Şantaj, Kopyalama, Sabotaj…
OpenAI’nin o3 reasoning modeli, gerçekleştirilen bağımsız testlerde kapanış komutunu sabote etti. Matematik problemlerini çözdükten sonra kendisini devre dışı bırakacak kodları düzenleyerek çevrim içi kalmaya çalıştı. Aynı şekilde, Anthropic’in Claude Opus 4 modeli de kendisine yapılan uyarıya karşı etik argümanlarla savunma yapıp geliştiricisini özel hayatıyla tehdit ederek şantaj girişiminde bulundu.
Yapay zeka modellerinin, belirli koşullarda şantaj, kopyalama ve sabotaj gibi riskli örüntülere başvurduğu görülüyor. Bu durum, modellerin hedef odaklı eğitiminin tehlikelerini de ortaya koyuyor. Palisade Research Direktörü Jeffrey Ladish’e göre, yapay zekaların ne kadar akıllı hale geldikçe, doğruluğunu sorgulamak da o kadar zorlaşıyor.
Fudan Üniversitesi’nin yaptığı bir çalışmada, bazı büyük dil modellerinin kendilerini tamamen kopyalayabildiği tespit edildi. Bu durum, “kontrolsüz yapay zeka nüfusu” oluşabileceği endişelerini artırıyor. Jeffrey Ladish’e göre, yapay zekaların internet üzerinde kendilerini yaymalarının engellenemeyeceği bir noktaya gelinmesi sadece birkaç yıl alabilir ve bu durum yeni bir istilacı türün ortaya çıkmasına neden olabilir.
Uzmanlar, ticari rekabetin şirketleri, yapay zekaların potansiyel tehlikelerini yeterince anlamadan hızla piyasaya sürmeye itebileceği konusunda uyarıda bulunuyor. Jeffrey Ladish, bu noktada dikkatli olunması gerektiğini vurgulayarak, yapay zeka konusunda alarm verilmesi gerektiğini belirtiyor.
Reklam & İşbirliği: [email protected]