GitHub HydraFusion: Göreve Göre Model Orkestrasyonu
GitHub, farklı yapay zekâ modellerini çalışma anında koordine eden Project HydraFusion’ı araştırma ön izlemesi olarak kullanıma sundu. Sistem, geliştiricinin her görev için model seçmesini beklemiyor; isteği analiz edip taslak oluşturma, eleştirme, revizyon ve daha güçlü bir modele geçiş gibi adımlardan uygun olanları bir araya getiriyor.
HydraFusion, geliştiricinin yalnızca bir model seçmesiyle kalite, maliyet ve gecikme arasındaki dengeyi gözeten bir çalışma akışı oluşturmayı amaçlıyor. Bu yapı, GitHub’ın yerel, bulut ve bileşik modeller arasında otomatik anlamsal yönlendirme stratejisinin bir parçası olarak konumlandırılıyor.
HydraFusion nasıl çalışıyor?
HydraFusion, iş akışı seçimini bir optimizasyon problemi olarak ele alıyor. Akıl yürütme, kod üretimi, hata ayıklama ve araç kullanımı gibi yetenek sinyallerini değerlendiriyor, ardından görevin kalite beklentisini karşılayacak en verimli yürütme biçimini seçiyor.
Sistem şu anda her istek için üç farklı yürütme modelinden birini kullanıyor:
- Single: Seçilen tek bir model görevi doğrudan tamamlıyor.
- Cascade: Verimli bir model ilk çözümü hazırlıyor. Kalite kontrolü sonucu yeterli bulunursa çözüm kabul ediliyor, aksi durumda daha güçlü bir modele geçiliyor.
- Critique: Bir model taslak hazırlıyor. Farklı bir model ailesinden, yalnızca okuma yetkisine sahip bağımsız bir eleştirmen sonucu inceliyor. Ardından ilk model bir kez revizyon yapıyor.
Bu üç yaklaşımın kalite ve maliyet dengesi farklı. Single, doğrudan çözülebilen görevlerde hızı ve verimliliği koruyor. Cascade, ilk denemeyi daha verimli bir modele yaptırıyor, gerektiğinde daha güçlü çıkarıma geçişe izin veriyor. Critique ise bağımsız bir değerlendirmeden yararlanmanın, aynı modelin ikinci denemesinden daha faydalı olabileceği görevleri hedefliyor.
Copilot CLI üzerinden araştırma ön izlemesi
HydraFusion, GitHub Copilot’ın tüm planlarındaki kullanıcılar için GitHub Copilot CLI içindeki /experimental aracılığıyla sunuluyor. Kullanım, HydraFusion’ın çalıştırdığı modellerin tükettiği token miktarına göre hesaplanıyor ve her modelin standart ücretlendirme oranı uygulanıyor.
Copilot CLI’da HydraFusion’ı denemek için kaynakta belirtilen adımlar şöyle:
- En yeni sürümü kurmak için
/updatekomutunu çalıştırın. /experimental onkomutuyla deneysel özellikleri açın./modelkomutunu çalıştırın ve HydraFusion (Research Preview) seçeneğini seçin.
GitHub, kullanıcıların geri bildirimlerini Copilot CLI içindeki /feedback üzerinden veya GitHub Community tartışmasında paylaşmasını istiyor.
Çalışma akışında kontrol ve güvenlik ilkeleri
HydraFusion’ın repository düzeyindeki görevlerde kullanılabilmesi için yürütme, inceleme, maliyet ve depo durumunun birlikte kontrol edilmesi gerekiyor. GitHub, sistemi beş temel ilke üzerine kurduğunu belirtiyor:
- Tam hesaplama: Taslak, eleştiri, revizyon, üst modele geçiş, yeniden deneme ve geri dönüş gibi tüm adımların maliyet ve kullanım bilgileri toplanıyor.
- Sınırlandırılmış yürütme: Her adım için zaman aşımı ve iptal davranışı tanımlanıyor. Böylece yürütme ve maliyet belirlenen sınırlar içinde tutuluyor.
- İzole inceleme: İnceleme adımları, araçlardan arındırılmış ve izole bağlamlarda yapılıyor. Çözüm üreten adımlar ise ortak çalışma alanını ve izin farkındalığına sahip ajan döngüsünü kullanıyor.
- Güvenli uygulama: İş akışı iptal edilirse veya doğrulamadan geçemezse herhangi bir yama uygulanmıyor. Böylece tamamlanmamış değişikliklerin depoya ulaşması engelleniyor.
- Doğrulanmış yönlendirme: İş akışı tanımları, model eşleşmeleri, geri dönüş davranışı ve model kullanılabilirliği çalıştırma başlamadan önce doğrulanıyor.
Çalışma zamanında her adımın rolü, sonucu, maliyeti, gecikmesi ve tanılama verileri kaydediliyor. Geliştiriciye ise bu karmaşık süreç, tek bir tutarlı yanıt ve izinlere duyarlı tek bir değişiklik kümesi olarak sunuluyor.
HydraFusion benchmark sonuçları
GitHub, HydraFusion politikalarını üç aracılı kodlama benchmark’ında çevrim dışı olarak değerlendirdi: TerminalBench 2.1, DeepSWE ve gerçek GitHub Copilot oturumlarına dayanan kurum içi CheckpointBench. Karşılaştırma tabanları Claude Opus 5 ve GPT-5.6 Sol oldu.
Değerlendirmelerde görev girdileri, araçlar, yürütme sınırları, fiyat varsayımları, puanlama koşulları ve eksik sonuçların ele alınış biçimi aynı tutuldu. Ölçülen metrik, doğru biçimde yanıtlandığı doğrulanan görevlerin oranı olan doğrulanmış görev kalitesiydi. Maliyet hesabına taslak, eleştiri, revizyon, üst modele geçiş, yeniden deneme ve geri dönüş dahil olmak üzere çağrılan tüm adımlar eklendi.
| Benchmark | Opus 5’e göre maliyet | Opus 5’e göre kalite |
|---|---|---|
| TerminalBench 2.1 | %67 daha düşük | +4,9 puan |
| DeepSWE | %36 daha düşük | -1,5 puan |
| CheckpointBench | %65 daha düşük | -0,1 puan |
TerminalBench 2.1, terminal ortamlarındaki karmaşık ve çok adımlı görevleri değerlendiriyor. Bu testte HydraFusion, Claude Opus 5’e kıyasla doğrulanmış görev kalitesini 4,9 puan artırdı, tahmini iş akışı maliyetini ise %67 azalttı.
DeepSWE, büyük kod tabanlarında gezinmeyi, dosyalar arası bağımlılıkları anlamayı ve uçtan uca düzeltmeler üretmeyi gerektiren repository düzeyindeki görevleri ölçüyor. HydraFusion bu benchmark’ta Opus 5’in 1,5 puan gerisinde kaldı, maliyeti ise %36 düşürdü.
CheckpointBench ise belirli herkese açık depolara ve değiştirilemez commit’lere bağlanan, gerçek Copilot ajan kodlama oturumlarından oluşturulmuş çok turlu bir benchmark. Dil, görev türü ve zorluk açısından dengelenen bu testte HydraFusion, Opus 5’e 0,1 puan yaklaştı ve %65 daha düşük maliyet gösterdi.
GitHub, sonuçların yalnızca değerlendirilen benchmark sürümleri, iş akışı yapılandırmaları, model havuzu ve fiyat varsayımları için geçerli olduğunu vurguluyor. Tüm modeller aynı orta düzey akıl yürütme seviyesinde değerlendirildi. Araştırma ön izlemesiyle birlikte gerçek geliştirici iş yüklerinde kalite, gecikme, güvenilirlik, önbellek verimliliği, maliyet ve güvenlik başlıklarında daha fazla veri toplanması planlanıyor.
Geliştirme süreci ve ön izlemenin kapsamı
HydraFusion’ın yönlendirme politikaları, geliştiricilerin GitHub Copilot’ı gerçek kodlama görevlerinde nasıl kullandığı temel alınarak şekillendirildi. CheckpointBench’teki gerçek Copilot oturum izleri yeniden üretilebilir hale getirildi ve politikalar üç benchmark genelinde tekrar tekrar iyileştirildi.
GitHub, karar politikalarını oluşturmak için elle eşik ayarlamak yerine beam search kullandığını belirtiyor. Her aday politika, kalite, maliyet ve hata türleri bakımından sabit bir temel karşısında ölçüldü. TerminalBench 2.1 üzerinde 11 Ağustos ile 25 Ağustos arasındaki geliştirme sürecinde değerlendirme altyapısındaki iki operasyonel hata geçersiz sonuçlar üretti. Bu sonuçlar performans eğiliminden çıkarıldı, hatalar düzeltildi ve ardından HydraFusion yapılandırmalarındaki geliştirme sürdürüldü.
Ön izleme için GitHub, tek istemle verilen ilk tür kodlama görevlerinin başlangıçta en uygun kullanım alanı olduğunu söylüyor. Uzun ve yinelemeli oturumlarda güçlü çok turlu performans ise sonraki odak noktaları arasında. Kullanıcıların Copilot’a tek bir istemle verebileceği kapsamı belirli kodlama görevleriyle başlaması ve sonuçları geri bildirmesi öneriliyor.
HydraFusion şu an aktif bir araştırma çalışması olarak tanımlanıyor. Sonuçlar, modeller, iş akışları, kullanılabilirlik, adlandırmalar ve ürün davranışı ön izleme sürecinde değişebilir. GitHub’ın yaklaşımı, her görev için en iyi modeli seçmekten, görevi çözmek için uygun çalışma biçimini çalışma anında oluşturmaya geçişi hedefliyor.
Projede GitHub ve Microsoft ekiplerinden Aashna Garg, Shengyu Fu, Carlos Castro, Siddharth Singha Roy ve Andy Salerno yer alıyor. GitHub ayrıca araştırmacılara, mühendislere, ürün yöneticilerine ve tasarımcılara; eğitim verilerini, eğitim hattını, değerlendirme paketlerini, istemci deneyimini ve sunum altyapısını oluşturmalarına yaptıkları katkılar için teşekkür ediyor.
Kaynaklar ve İleri Okuma
- GitHub Project HydraFusion duyurusu
- GitHub Copilot Auto model selection belgeleri
- GitHub Copilot CLI kullanım belgeleri
- Copilot CLI Rubber Duck yaklaşımı
- GitHub Community geri bildirim tartışması







Yorum gönder