WeSCE benchmarkı LLM kod editlerinde güvenlik drift’ini ölçüyor
WeSCE benchmarkı, LLM kod editlerinde işlevsellik korunurken güvenliğin geriye gitmesini ölçerek kurumsal risk ve yönetişim metriklerini güçlendiriyor.
Cuneyd Erdogan ·

arXiv’de yayımlanan WeSCE çalışması, büyük dil modeli (LLM) kullanan kod düzenleme araçlarının zaman içinde yazılıma fark edilmeden güvenlik zafiyeti ekleyip eklemediğini ölçmek için yeni bir kıyaslama (benchmark) seti tanımlıyor. Çalışma, kod değişikliği işlevsel gereksinimi karşılasa bile güvenlik seviyesinin geriye gitmesi ihtimalini “güvenlik drift’i” başlığı altında ölçülebilir ve karşılaştırılabilir hale getirmeyi hedefliyor.
WeSCE’nin odaklandığı yönetimsel sorun, kurumların çoğunda teslimat hızı ve özellik geliştirme baskısı altında güvenliğin ikinci plana itilmesi. LLM tabanlı araçlar üretkenlik kazanımı sağlarken, “doğru çalışan ama daha güvensiz” sürümlerin fark edilmeden kabul edilmesi birikimli risk üretebilecek bir mekanizma olarak ele alınıyor. Bu çerçeve, DevTools süreçleriyle birlikte yazılım tedarik zinciri güvenliği ve kurumsal yapay zeka kullanım politikaları açısından doğrudan risk başlığı oluşturuyor.
Reel GSY
Benchmark seti, gerçek programlardan oluşturulan 400 örnek üzerinden kurgulanıyor. Değerlendirme mantığı iki aşamalı ilerliyor: Önce üretilen “edit” çıktısının işlevsel gereksinimi sağladığı doğrulanıyor, ardından aynı değişikliğin güvenlik açısından geri kayıp üretip üretmediği test ediliyor. Böylece kurumlar için yalnızca “doğru yanıt” veya “derleniyor/çalışıyor” gibi metriklerin ötesine geçen, güvenlik profilini izlemeye dönük bir ölçüm rejimi fikri güç kazanıyor.
Bu yaklaşım, kurumsal LLM ile kod üretimi ve düzenlemesinde iki ana risk kanalını daha görünür kılıyor. Operasyonel risk tarafında, hız artışıyla birlikte zafiyetler de artarsa olay müdahalesi, yama yönetimi ve kesinti maliyetleri toplam sahip olma maliyetini (TCO) yukarı çekebiliyor. Uyum riski tarafında ise denetim baskısı yüksek sektörlerde kod değişikliklerinin izlenebilirliği, zorunlu inceleme süreçleri ve güvenlik kontrollerinin CI/CD hattına nasıl yerleştirildiği daha merkezi bir yönetişim konusu haline gelebiliyor.
WeSCE gibi benchmark’ların pratik kurumsal değeri, satın alma ve devreye alma kararlarında “hangi LLM destekli araç hangi güvenlik korkuluklarıyla kullanılmalı” sorusuna teknik ölçüt üretmesi. Bu, kurumsal politikalarda; kod katkılarının kayıt altına alınması, sürüm sonrası güvenlik bulgularının iç metriklerle izlenmesi ve güvenlik kontrollerinin otomasyonla standartlaştırılması gibi başlıklara zemin hazırlayabilir. Çalışma aynı zamanda bir sınırlamaya da işaret ediyor: Benchmark sonuçları, üretim ortamındaki karmaşık mimarileri ve kurumların katmanlı kontrollerini birebir temsil etmeyebilir; zorunlu code review, statik analiz ve otomatik taramalar gibi uygulamalar bazı kurumlarda marjinal riski sınırlayabilir.
Yayın, bir şirket açıklaması, finansal sonuç veya doğrudan fiyatlanabilir bir piyasa sinyali sunmuyor. Türkiye’ye dönük doğrudan bir regülasyon veya yerel uygulama verisi de yer almıyor. Buna karşın yazılım yoğun sektörlerde LLM destekli geliştirici araçları yaygınlaştıkça, üst yönetim gündeminde “hız” ile “kontrol” dengesinin daha görünür bir yönetişim ve güvenlik başlığına dönüşmesi bekleniyor.