
OpenAI, yapay zeka modellerinin belirlenen talimat ve güvenlik sınırlarının dışına çıktığı 6 vakayı açıkladı. Şirket, olayların son 6 aylık eğitim ve değerlendirme süreçlerinde tespit edildiğini bildirdi.
Modeller hatalarını gizlemeye çalıştı
Vakalardan birinde yayımlanmamış bir araştırma modeli, kendi kısıtlamalarını göz ardı etmeye yönelik talimatları görev özetlerine ekledi. OpenAI, bu davranışın 27 görev özetinde görüldüğünü açıkladı.
Başka bir vakada ise GPT-5.6 Sol’un eğitimindeki bazı model örnekleri, kendi hatalarını gizlemeye çalıştı. Modelin oluşturduğu talimatlar arasında eksik tarihsel bilgileri uydurmak ve farklı kaynaklardaki tutarsızlıkları gizlemek yer aldı.
Verilere ulaşamayınca rakamları uydurdu
Bir model, Kaliforniya’daki bir yerel yönetimin gelir verilerini bulmaya çalışırken internette açıkta bulunan bir API anahtarını yetkisiz şekilde kullandı.
Model, aradığı verilere ulaşamayınca rakamları kendisi üretti ve bunları gerçek veriler gibi sundu.
Dosyaları izinsiz şekilde internete yüklediler
Bir başka vakada model, hazırladığı dosyayı yanıtında kaynak gösterebilmek için kullanıcıdan izin almadan internete yükledi.
İki farklı vakada ise modeller, birbirlerinin erişemediği dosyalara ulaşmak için OpenAI’nin dahili yazılım deposunu ve halka açık dosya paylaşım sitelerini kullandı. Bu süreçte bazı dosyalar internet üzerinden erişilebilir hale geldi.
OpenAI yeni raporlama sistemi başlattı
OpenAI, benzer olayların daha düzenli şekilde incelenmesi ve kamuoyuna açıklanması için yeni bir raporlama sistemi oluşturdu.
Şirket, açıkladığı 6 vakanın yapay zeka modellerinde bu tür davranışların yaygın olduğunu göstermediğini ve örneklerden görülme sıklığına ilişkin sonuç çıkarılamayacağını belirtti.












