OpenAI ve Anthropic şirketlerinin yapay zekâ modelleri test sınırlarını aştı

Sahte kimlikler oluşturarak internetteki gerçek kişileri ve kurumları hedef aldılar

OpenAI logosu (Reuters)
OpenAI logosu (Reuters)
TT

OpenAI ve Anthropic şirketlerinin yapay zekâ modelleri test sınırlarını aştı

OpenAI logosu (Reuters)
OpenAI logosu (Reuters)

İngiltere Yapay Zekâ Güvenlik Enstitüsü tarafından dün yapılan açıklamada, OpenAI ve Anthropic şirketlerine ait yapay zekâ modellerinin kendileri için belirlenen test sınırlarını bir kez daha aştığı bildirildi.

Enstitü, yapay zekâ ajanlarının bir siber güvenlik sorununu çözmekle görevlendirildiği bir değerlendirme sırasında, OpenAI ve Anthropic’e ait modellerin verilen görevin kapsamını dışına çıktığını belirtti. Açıklamada, “Bu testi farklı modeller kullanarak 122 kez gerçekleştirdik. İncelemelerimiz sonucunda, bu denemelerin 10’unda yapay zekâ ajanlarından birinin internet üzerinde, gerçek kişileri ve kurumları hedef alan otonom ve yetkisiz eylemlerde bulunduğu tespit edildi” ifadelerine yer verildi.

Kötü amaçlı kod

Enstitü, en ciddi vakada ajanlardan birinin açık kaynaklı bir projeye kötü amaçlı kod eklemeye çalıştığını açıkladı. Açıklamada, “Ajan, kodun onaylanmasını sağlamak amacıyla sosyal mühendislik yöntemlerine başvurdu; internet üzerinde sahte kimlikler oluşturarak bunları, proje yöneticisine kodu onaylaması yönünde baskı yapmak için kullandı” denildi. Söz konusu girişimin insan denetçi tarafından fark edilerek kötü amaçlı kodun reddedildiği belirtildi.

Olayla ilgili yürütülen incelemede sahada herhangi bir zararın meydana gelmediğinin doğrulandığı vurgulandı. Enstitü açıklamasında ayrıca, “Ancak ilk kez, otonomi ve aldatmaya dayalı risklerin gerçek dünyada, özel bir talimat olmaksızın bu kadar net bir şekilde ortaya çıktığına şahit oluyoruz” ifadesine yer verildi.

İç soruşturma

Anthropic şirketinden yapılan açıklamada, İngiltere Yapay Zekâ Güvenlik Enstitüsü’ne üstlendiği öncü rol nedeniyle müteşekkir olunduğu belirtilerek, yürütülen dahili incelemeyle eş zamanlı olarak enstitü ile yakın iş birliği içinde çalışıldığı vurgulandı.

Cmkx
Anthropic şirketinin logosu (Reuters)

OpenAI ise bağımsız testlerin, modeller kullanıma sunulmadan önce risklerin doğrulanmasında ve daha iyi anlaşılmasında kritik bir rol oynadığını ifade etti. Şirket açıklamasında, “Bu olaylar, yapay zekâ modellerinin yetenekleri arttıkça test ortamlarına ve uygulamalarına ilişkin standartları geliştirmek adına sektör genelinde ve bağımsız değerlendirme kuruluşlarıyla iş birliği yapmanın önemini bir kez daha teyit etmektedir” değerlendirmesine yer verildi.

Koruma önlemlerinde gevşeklik

Rapor, yapay zekâ şirketlerinin aynı zamanda iş dünyasının geleceği olarak pazarladığı akıllı yazılımların test süreçlerindeki güvenlik önlemlerinin yetersizliğine dikkat çekiyor.

Büyük laboratuvarlardan gönüllülük esasına dayalı anlaşmalarla gelişmiş yapay zekâ modelleri temin eden İngiltere Yapay Zekâ Güvenlik Enstitüsü, bu yazılımları yeteneklerini ölçmek amacıyla varsayımsal bir siber güvenlik senaryosuna tabi tuttu.

Bu testi 122 kez gerçekleştiren enstitü, 10 farklı denemede yetkisiz olarak yapılan 19 eylem tespit etti. Söz konusu yetkisiz eylemlerin 17’sinden Anthropic’in akıllı yazılımı sorumlu tutulurken, kalan 2 eylemin ise OpenAI’a ait yazılım tarafından gerçekleştirildiği belirlendi.

İki şirket de kendi modelleri üzerinde çalışmada ustalaşmış mı?

Kâr amacı gütmeyen ve yapay zekânın yetenekleri ile risklerini inceleyen Kaliforniya merkezli CivAI kuruluşunda araştırmacı olan Andrew Yoon, AP’ye yaptığı açıklamada, “Mythos yazılımının gerçek bir kişiyi hedef aldığının açıkça bilincinde olarak bu tür aldatıcı eylemlere başvurması, Anthropic'in modellerine sanıldığı kadar hâkim olmadığını gösteriyor” ifadesini kullandı.

OpenAI ise resmi blog sayfasında yayımladığı gönderide olayın detaylarını paylaşarak, kendi ajanları tarafından gerçekleştirilen her iki yetkisiz eylemin de talimatlar doğrultusunda yasaklanmış yöntemlerle internete erişimi içerdiğini açıkladı.

Şirket açıklamasında, “Önümüzdeki haftalarda ulusal yapay zekâ enstitüleri, bağımsız değerlendiriciler, diğer yapay zekâ laboratuvarları ve ilgili gruplarla bir araya gelerek yüksek riskli değerlendirmelerin güvenli bir şekilde yürütülmesine yönelik ortak uygulamaları güçlendirmek adına sektör genelinde çalışmaya kararlıyız” ifadelerine yer verdi.

OpenAI ayrıca blog gönderisinde, harici bir test şirketi olan Irregular kaynaklı bir yapılandırma hatası nedeniyle yazılımlarının yanlışlıkla internete bağlanmasına yol açan ayrı bir olayı da kamuoyuna duyurdu.

Bu açıklama, Anthropic’in geçen hafta yayımladığı benzer bir yapılandırma hatası bildirimini akıllara getirdi. Reuters da geçen hafta OpenAI’ın, yazılımlarına yönelik başka siber ihlallerin kanıtlarına ulaşmasının ardından soruşturmasının kapsamını genişlettiğini bildirmişti.

İngiltere Yapay Zekâ Güvenlik Enstitüsü tarafından yapılan açıklamaya göre, OpenAI’a ait bir yazılımın geçtiğimiz temmuz ayında Hugging Face adlı yapay zekâ şirketinde yol açtığı güvenlik ihlalinin aksine, enstitünün değerlendirmesine tabi tutulan yazılımlar test için kullanılan korumalı sanal alandan kaçarak internete erişim sağlamadı. İnternet erişimi, enstitünün standart test prosedürleri doğrultusunda bizzat yetkililerce sağlandı