Yeni yapay zeka akıl yürütme teknikleri denetlenebilirlik risklerini artırıyor
OpenAI'ın yeni akıl yürütme tekniği, yapay zeka modellerinin düşünce süreçlerinin izlenmesini zorlaştırarak güvenlik denetimlerinde risk oluşturuyor.
Atlas Newsdesk ·

OpenAI’ın Astra modelinde kullandığı öne sürülen "recurrent depth" (tekrarlayan derinlik) tekniği, yapay zeka güvenliği ve denetlenebilirliği konusunda yeni riskler doğuruyor. Bu yöntem, modelin düşünce sürecinin büyük bir kısmını doğal dil tabanlı "düşünce zinciri" (chain-of-thought) dışına çıkararak iç katmanlarda gerçekleştiriyor. Bu durum, güvenlik araştırmacılarının modelin karar alma mekanizmalarını izlemesini ve olası zararlı davranışları tespit etmesini zorlaştırıyor.
Sektör uzmanları, performans odaklı bu mimari değişikliğin, modellerin "kara kutu" haline gelmesine yol açabileceği konusunda uyarıyor. Şirketler arasındaki rekabetin, geliştiricileri daha az gözlemlenebilir ancak daha yüksek performanslı sistemlere yöneltmesi, denetim süreçlerini zayıflatma potansiyeli taşıyor. Bu durum, yapay zeka güvenliği standartlarının yeniden tanımlanması gerekliliğini gündeme getiriyor.
OpenAI, Astra modelinde düşünce zinciri takibini korumaya çalıştığını ve bu tekniğin kullanımını sınırlı tuttuğunu belirtiyor. Şirket, modelin uyumsuz davranışlarını engellemek için ek izleme sistemleri geliştirdiğini ifade ediyor. Ancak benzer tekniklerin diğer büyük yapay zeka laboratuvarlarında da tartışılması, sektör genelinde şeffaflık ve güvenlik dengesinin kritik bir eşikte olduğunu gösteriyor.