Yapay Zeka Yazılım Geliştirmede Hata Öğrenimi Öne Çıkıyor

Yeni bir araştırma, yapay zeka ajanlarının hatalarından öğrenerek yazılım geliştirme yeteneklerini artırdığını gösteriyor.

Edward Mullen ·

Yapay Zeka Yazılım Geliştirmede Hata Öğrenimi Öne Çıkıyor

Yapay Zeka Hatalarından Öğreniyor

Büyük bir şirkette kıdemli bir geliştirici, yapay zeka tarafından oluşturulan kod değişikliklerini incelerken genellikle anlık doğruluğa odaklanır. Ancak son çalışmalar, bir depodaki en değerli varlığın tamamlanmış kod değil, ajanın bir çözüme ulaşmadan önceki her başarısız denemesinin 'izleri' olduğunu ortaya koyuyor. Yakın zamanda yayımlanan bir ön baskı, bu geçmiş çözüm izlerini yinelemeli öz-gelişim için temel bir bileşen olarak ele alan Socratic-SWE adlı bir çerçeve sunuyor.

Yazılım mühendisliği (SWE) ajanlarını eğitmek için mevcut yöntemler, genellikle önceden belirlenmiş sorunları modellere zorla besleyen sentetik yaklaşımlara dayanıyordu. Socratic-SWE makalesi, bu dağılımların genellikle bir ajanın kendine özgü zayıflıklarından bağımsız olduğunu savunuyor.

Üç yinelemeden sonra SWE-bench Verified kıyaslamasında %50,40 başarı oranına ulaşan Socratic-SWE ekibi, yazılım geliştirmenin iş ekonomisinde bir değişimin sinyalini verdi: modelin birincil rolü artık sadece çözmek değil, aynı zamanda kendi çözememe yeteneğini sınıflandırmak.

Hata Enjeksiyonundan Beceri Damıtmasına Geçiş

Teknoloji yöneticileri ve mühendislik liderleri için, otonom kodlama ajanlarını dağıtmanın mevcut darboğazı, bir modelin ilerlemesine ayak uyduracak yüksek kaliteli, gerçek dünya SWE görevlerinin eksikliğidir. Çoğu sentetik veri üreteci statiktir; bir model belirli bir hata türünü çözmeyi öğrendiğinde, o hata türünden daha fazlası marjinal fayda sağlamaz.

Socratic-SWE, ajanın geçmiş izlerini bir eğitim sinyali kaynağı olarak yeniden kullanarak bu durumu kırıyor. İzleri basit bir ödül hesaplaması için kanıt olarak ele almak yerine, sistem bunları 'yapılandırılmış ajan becerileri'ne dönüştürüyor – tekrarlayan başarısızlıkların ve bunları düzeltmek için gereken belirli onarım modellerinin kısa özetleri.

Sonuçlara göre eğitimden süreçlere göre eğitime geçiş, geliştirme araçları için tedarik hesaplamasını değiştiriyor. Bu modelde, 'Çözücü' izler üretir ve bunlar daha sonra gerçek depolarda hedeflenen görevlerin oluşturulmasına rehberlik etmek için kullanılır.

Bu aday görevler daha sonra yürütme tabanlı doğrulama yoluyla çalıştırılır ve yazarların 'çözücü-gradyan hizalama ödülü' olarak adlandırdığı bir puanla değerlendirilir. Bu, eğitim için yalnızca doğrulanabilir ve ajanın mevcut yetenek boşluklarını kapatmak için özel olarak ayarlanmış görevlerin tutulmasını sağlar.

Fatura Edilebilir Saatin Mantığını Tersine Çevirmek

Yazılım geliştirmede ajans, uç durumları ele alma yeteneği ile tanımlanıyorsa, Socratic-SWE, yapay zeka pazarındaki rekabet avantajının, model başarısızlığı hakkında en açıklayıcı verilere sahip olana doğru kaydığını öne sürüyor. Geleneksel hukuk veya danışmanlık modelinde, fatura edilebilir saat değer birimidir.

Ajan tabanlı bir SWE modelinde, değer giderek 'çözücü-gradyan'da veya modelin şu anda yapabildiği ile kaçırdığı arasındaki farkta bulunur. Bu bir marj yapısı değişimidir: kurumsal maliyet, büyük bir genç geliştirici kadrosunu sürdürmekten (genellikle 'kolay' görevleri çözenler) karmaşık, depo genelindeki hataların 'kuyruğu' için ajan becerilerini geliştiren yoğun hesaplama gerektiren öz-gelişim döngülerini sürdürmeye kayar.

Socratic-SWE araştırmacıları, çerçevelerini SWE-bench Lite, SWE-bench Pro ve Terminal-Bench 2.0'a karşı test ettiler. Her durumda, Socratic-SWE, aynı hesaplama bütçesi içinde kalırken kendi kendini geliştiren temel çizgilerden sürekli olarak daha iyi performans gösterdi.

Bir mühendislik organizasyonu için bu, bir yapay zeka dağıtımının etkinliğinin yakında 'izden beceriye' dönüşüm oranıyla ölçüleceği anlamına gelir – sistemin belirli bir mantık hatasının tekrarını önleyen bir eğitim görevi oluşturması için kaç başarısız PR gerekir?

Statik Kıyaslama Döneminin Sonu

SWE-bench Verified'daki %50,40'lık rakam, sadece bir kıyaslama yüksek su işareti olarak değil, aynı zamanda kapalı döngü evrimi için bir kavram kanıtı olarak da önemlidir. Önümüzdeki 12 ila 18 ay içinde, GitHub'ın dondurulmuş anlık görüntülerinde eğitilmiş 'statik' ajanlar ile belirli bir kurumsal kod tabanında kendi yürütme izleri üzerinde sürekli olarak ince ayar yapılan 'gelişen' ajanlar arasında bir ayrım beklemeliyiz.

Bu, güçlü bir satıcı kilitleme mekanizması yaratır: özel, tescilli bir kod tabanında üç beceri damıtma yinelemesi gerçekleştirmiş bir ajan, üçüncü bir tarafın yeni bir SOTA modelinden önemli ölçüde daha etkili olacaktır.

Gözlemciler orta vadede üç özel sinyali izlemelidir. İlk olarak, lisans anlaşmalarında 'koltuk başına'dan 'yineleme başına'ya bir kayma arayın; burada değer, modelin kendi kendini geliştirme döngülerine bağlıdır.

İkincisi, ham ajan günlüklerini Sokratik tarzı damıtma için gereken yapılandırılmış becerilere dönüştürmede uzmanlaşmış 'iz temizleme' girişimlerinin ortaya çıkışını takip edin. Son olarak, yürütme tabanlı doğrulamanın doğrudan IDE'lere entegrasyonunu izleyin, yerel geliştirici ortamını sürekli bir eğitim verisi fabrikasına dönüştürün.

Bu sinyaller geçerliyse, bir modelin 'eğitim' aşaması artık ayrı, aylarca süren bir sermaye harcaması olayı değil, yazılım geliştirme yaşam döngüsünün sürekli, otomatik bir parçası olacaktır.

More stories