İçeriğe atla
Şimdi yükleniyor
AKAşkın KILIÇ
  • Anasayfa
  • Azure & Bulut
    • Microsoft Azure
    • Bulut Altyapı
    • Microsoft 365
  • Yazılım
    • DevOps
    • Geliştirici Araçları
    • Konteyner & K8s
  • AI & Veri
    • Yapay Zeka
    • Veri & Analitik
  • Güvenlik
    • Güvenlik & Kimlik
    • Kurumsal Teknoloji
  • Hakkımda
    • İletişim
×
  • Azure
  • Bulut Altyapı
  • DevOps
  • Geliştirici Araçları
  • Güvenlik & Kimlik
  • Konteyner & Kubernetes
  • Kurumsal Teknoloji
  • Microsoft 365
  • Microsoft Azure
  • Veri & Analitik
  • Yapay Zeka
  • Başlangıç
  • DevOps
  • Microsoft 365 Copilot Agent Evaluations: Ajan Kalitesi Ölçümü
Bulut Altyapı DevOps Microsoft 365 ajan değerlendirme, Azure OpenAI, CI/CD, Copilot Agent Evaluations, LLM judge, Microsoft 365 Copilot, regression test, skor kartı Aşkın KILIÇ 09/05/2026 2 Yorumlar

Microsoft 365 Copilot Agent Evaluations: Ajan Kalitesi Ölçümü

Microsoft 365 Copilot Agent Evaluations: Ajan Kalitesi Ölçümü
⏱️ 8 dk okuma📅 9 Mayıs 2026🔄 Güncelleme: 23 Ağustos 2026

Bir Copilot ajanı demoda kusursuz cevap verir, canlıya çıkınca aynı soruya saçmalar. Tanıdık bir tablo. Peki bir ajanın yanıt kalitesini nasıl ölçer ve nasıl artırırsınız? Microsoft 365 Copilot Agent Evaluations aracı artık genel kullanıma (GA) açık; güncel kurulum ve ölçüm akışı Microsoft Learn Agent Evaluations CLI belgesinde yayımlanıyor. Yazıda hem ölçüm tarafını (skorlar, test setleri, CI/CD entegrasyonu) hem de asıl merak edileni, skorları yukarı çekmenin somut yöntemlerini ele alıyoruz.

İçindekiler

  1. Copilot yanıt kalitesi neden ölçülmeli?
  2. Microsoft 365 Copilot Agent Evaluations nedir?
  3. Yanıt kalitesini ölçme: adım adım
  4. Copilot yanıt kalitesini artırma yöntemleri
  5. CI/CD ve otomasyona taşıma
  6. Aracın eksik yönleri
  7. Sıkça Sorulan Sorular

Copilot yanıt kalitesi neden ölçülmeli?

Ajan geliştirmenin en sinsi tuzağı, kalitenin bir his olarak kalması. “Bugün iyi cevap verdi, dün kötüydü” gözlemi elle tutulur bir şey değil; sistem promptunu değiştirdiğinizde işlerin gerçekten iyileşip iyileşmediğini söyleyemezsiniz. Ölçüm bu belirsizliği sayıya çevirir. Elinizde bir skor olduğunda “baseline’a göre yüzde 15 daha iyiyiz” diyebilir, bir değişikliğin faydalı mı zararlı mı olduğunu kanıtlayabilirsiniz.

Proof-of-concept aşamasında bile ölçmeye başlamak, ileride çekilecek acıyı bugünden hafifletir. Production’a giderken “kalite ne durumda?” sorusunun cevabı elde hazır olur. Küçük gibi görünen ama bütün geliştirme döngüsünü disipline eden bir alışkanlıktır bu.

Microsoft 365 Copilot Agent Evaluations nedir?

Agent Evaluations, tenant’ınıza deploy ettiğiniz bir Copilot ajanını bir test setine karşı çalıştırıp yanıtlarını otomatik puanlayan bir araç. Araç artık genel kullanıma açık. Değerlendirmeyi birkaç farklı evaluator üzerinden yapıyor:

  • Coherence: Cevabın tutarlı, anlaşılır ve kendi içinde çelişkisiz olup olmadığını ölçer.
  • Groundedness: Cevabın verilen kaynaklara dayanıp dayanmadığını, yani ajanın uydurup uydurmadığını denetler.
  • ExactMatch: Cevabın beklenen çıktıyla birebir eşleşmesini arar; deterministik senaryolar için.
  • PartialMatch: Beklenen anahtar ifadelerin cevapta geçip geçmediğine bakar; daha esnek senaryolar için.

Aracı komut satırından çalıştırıyorsunuz. Tipik bir çağrı şöyle görünür:

# Örnek bir CLI çağrısı (preview komutları değişebilir)
m365agents eval run \
--agent-id "your-agent-id" \
--test-set./tests/sales-queries.json \
--evaluators coherence,groundedness,partialmatch \
--output./reports/scorecard.html
İpucu: Test setinizi JSON formatında tutun ve git deposuna commit edin. Böylece değerlendirme, code review sürecinin doğal bir parçası olur; her yeni test, ajanın o senaryoyu desteklemesi gerektiği anlamına gelir.

Yanıt kalitesini ölçme: adım adım

Aracı denemek istiyorsanız şu sırayı izleyin. Acele etmeyin; ilk üç adım araçtan bağımsızdır ve asıl değeri onlar üretir.

  1. Önce test seti hazırlayın. Aracı kurmadan önce yapın bunu. Kullanıcılarınızdan gerçek prompt örnekleri toplayın; başlangıçta 20 tane bile yeter.
  2. Beklenen çıktıları yazın. Her prompt için “ajan ne demeli?” sorusunun cevabını netleştirin. Sıkıcı ama atlanmaması gereken kısım burasıdır.
  3. Baseline alın. Mevcut ajanı çalıştırıp skoru kaydedin. Sıfırıncı gün referansınız bu olur.
  4. İyileştirmeleri ölçün. Her sistem promptu değişikliğinde veya knowledge ekleyip çıkardığınızda tekrar çalıştırın; skor yukarı çıktı mı diye bakın.
  5. CI/CD’ye dahil edin. En son adım budur, ilk günden zorlamayın.

Bu yaklaşım, Microsoft Agent Framework ile.NET’te Ajan Kurmanın İncelikleri yazısındaki mantıkla aynı çizgide: ölçmeden iyileştirmeye çalışmak, körlemesine ilerlemek demek.

Copilot yanıt kalitesini artırma yöntemleri

Ölçüm tek başına skoru yükseltmez; size nereye müdahale edeceğinizi söyler. Evaluation sonuçlarını okuduktan sonra devreye giren, yanıt kalitesini gerçekten artıran yöntemler şunlar:

  • Sistem promptunu netleştirin. Ajanın rolünü, kapsamını, sınırlarını ve cevap formatını açıkça yazın. Belirsiz talimatlar, tutarsız cevapların en yaygın kaynağıdır ve genellikle Coherence skorunda kendini gösterir.
  • Grounding kaynaklarını doğru seçin. Groundedness skoru düşükse sorun çoğu zaman ajanda değil, ona bağladığınız bilgi kaynaklarındadır. Alakasız veya güncel olmayan kaynakları çıkarın, doğru dokümanlara yönlendirin.
  • Retrieval kapsamını daraltın. Çok geniş bir bilgi tabanı gürültü üretir; ajan hangi belgeye bakacağını şaşırır. Kapsamı senaryoya göre daralttığınızda cevaplar hem daha isabetli hem daha tutarlı olur.
  • Örnekle yönlendirin (few-shot). Beklenen cevabın iki üç örneğini prompta eklemek, ajanın ton ve format konusunda ne istediğinizi anlamasını hızlandırır.
  • Skoru rehber alarak iterasyon yapın. Coherence düşükse prompt ve yapıya, Groundedness düşükse kaynaklara odaklanın. Her değişiklikten sonra test setini yeniden çalıştırıp skorun yönünü izleyin.
  • Regression’ı önleyin. Bir senaryoyu düzeltirken başka birini bozmak kolaydır. Test setini her değişiklikte baştan çalıştırmak, eski skorların gerilemediğinden emin olmanızı sağlar.

Kısacası artırma döngüsü şu: ölç, en zayıf skoru bul, kaynağına göre (prompt mı, grounding mı) müdahale et, tekrar ölç. Bu döngüyü birkaç tur çevirdiğinizde skorlar istikrarlı biçimde yükselir.

CI/CD ve otomasyona taşıma

Araç CLI tabanlı olduğu için Azure DevOps veya GitHub Actions içinde tek bir adım olarak çalışır. Test setini repoda tutun, her pull request’te CLI’yı tetikleyin, üretilen scorecard’ı artifact olarak saklayın. Skor belirli bir eşiğin altına düşerse exit code kontrolüyle PR’ı bloke edebilir, kaliteyi merge kapısına bağlayabilirsiniz.

İlginç bir ayrıntı: araç, “vibe-code” ile geliştirdiğiniz coding agent’ların içinden de çağrılabiliyor. Yani Claude Code, GitHub Copilot Workspace ya da benzer bir agent’la kod yazarken o agent sizin için evaluation tetikleyebiliyor. Bir ajanı geliştiren coding agent’ın gidip ajanın kalitesini ölçen değerlendirme aracını çağırdığı bir döngü açıyor bu. Durable Workflows ile Microsoft Agent Framework: Gerçek Hayatta Ne İşe Yarıyor? yazısında bu tür agent-to-agent senaryolarını daha ayrıntılı ele almıştık.

Aracın eksik yönleri

Preview olduğu için bazı sınırları peşinen kabul etmek gerekiyor:

  • Şu an yalnızca declarative agent destekleniyor; custom engine agent’lar için değerlendirme henüz yok.
  • Türkçe değerlendirme kalitesi net değil. Coherence ve Groundedness modelleri İngilizceye daha iyi ayarlı göründüğü için Türkçe test setlerinde skorlar biraz daha gürültülü çıkabilir.
  • Azure OpenAI maliyet takibi yok. Evaluation çalıştırdığınızda faturanızın ne kadar arttığını araç içinden göremiyorsunuz.
  • A/B testing native değil. İki farklı ajan versiyonunu karşılaştırmak için şimdilik manuel uğraşmak gerekiyor.
  • Çıktı yalnızca HTML scorecard. CSV veya JSON export olmadığı için skor trendlerini Power BI gibi araçlara akıtmak ek parsing gerektiriyor.

Kurulumda sık karşılaşılan bir sorun da şu: ajan, evaluation’ın seçtiği declarative agent picker’da görünmüyor. En yaygın nedeni, ajanın Agents Toolkit ile deploy edilip publish edilmemiş olması; publish edildikten sonra picker’da beliriyor ve değerlendirme çalışıyor. Hata mesajları henüz yeterince açıklayıcı değil, bu tür ayrıntıların GA sürecinde düzeleceğini umuyoruz.

Sıkça Sorulan Sorular

Microsoft 365 Copilot Agent Evaluations aracı ücretli mi?

CLI, Microsoft’un açık kaynak m365-copilot-eval deposunda yayımlanıyor. LLM tabanlı puanlama Microsoft Foundry projesi ve model deployment’ı kullanır; gerçek maliyet model, token hacmi ve bölge fiyatlandırmasına göre değiştiği için sabit bir tutar varsaymayın.

Hangi tür ajanları değerlendirebilirim?

Değerlendirme hedefi M365_AGENT_ID veya M365_TITLE_ID ile seçilir. Destek kapsamı ve gerekli Microsoft Foundry değişkenleri sürümlerle değişebildiğinden, çalıştırmadan önce güncel resmî gereksinimleri doğrulayın.

Copilot yanıt kalitesini nasıl artırırım?

Önce evaluation ile en zayıf skoru bulun. Coherence düşükse sistem promptunu netleştirin ve cevap formatını sabitleyin; Groundedness düşükse ajanı doğru bilgi kaynaklarına bağlayın ve retrieval kapsamını daraltın. Her değişiklikten sonra test setini yeniden çalıştırıp skorun yükseldiğini doğrulayın.

CI/CD pipeline’a nasıl entegre ederim?

CLI tabanlı olduğu için Azure DevOps veya GitHub Actions içinde bir step olarak çalıştırabilirsiniz. Test setini repoda tutun, her PR’da CLI’yı tetikleyin, scorecard’ı artifact olarak saklayın. Skor belirli bir eşiğin altına düşerse exit code kontrolüyle PR’ı engelleyebilirsiniz.

Türkçe promptlar için skorlar güvenilir mi?

Henüz tam güvenilir değil. LLM-judge modelleri çok dilli olsa da İngilizceye daha iyi ayarlı. Türkçe test setlerinizde skorların biraz daha gürültülü çıkmasını bekleyebilirsiniz; önce birkaç pilot çalıştırıp kendi baseline’ınızı oluşturmanız şart.

ExactMatch ve PartialMatch ne zaman kullanılır?

Deterministik çıktı beklediğiniz durumlarda ExactMatch mantıklıdır; örneğin form dolduran bir ajanın “tutar: 1500 TL” gibi spesifik bir formatı koruması gerekiyorsa. Daha esnek senaryolarda ise PartialMatch ile anahtar ifadelerin cevapta geçip geçmediğini kontrol edebilirsiniz.

Kaynaklar ve İleri Okuma

  • Announcing the public preview of the Microsoft 365 Copilot Agent Evaluations tool — Microsoft DevBlogs
  • Microsoft 365 Copilot Extensibility — Resmî Dokümantasyon
  • Microsoft 365 Agents Toolkit Documentation
🤖Bu yazı yapay zeka (büyük dil modelleri) ile hazırlanmış, insan editör tarafından incelenmiştir. İçerik üretim sürecimiz.
Aşkın KILIÇ
Aşkın KILIÇYazar

20+ yıl deneyimli Azure Solutions Architect. Microsoft sertifikalı bulut mimari ve DevOps danışmanı. Azure, yapay zekâ ve bulut teknolojileri üzerine Türkçe teknik içerikler üretiyor.

AZ-305AZ-104AZ-500AZ-400DP-203AI-102

İlgili Yazılar

GitHub Copilot’un PR Etkisi Ölçülüyor: Yeni Metrikler
GitHub Copilot’un PR Etkisi Ölçülüyor: Yeni Metrikler9 Nis 2026
.NET Day Agentic Modernization: Eski Uygulamalara Yeni Hayat
.NET Day Agentic Modernization: Eski Uygulamalara Yeni Hayat16 Haz 2026
Elasticsearch Sorgularını Azure Cosmos DB'ye Çevirmek
Elasticsearch Sorgularını Azure Cosmos DB'ye Çevirmek2 Eki 2026
GPT-5.5 GitHub Copilot'a Geldi: Ne Değişiyor, Ne Kadar Ediyor?
GPT-5.5 GitHub Copilot'a Geldi: Ne Değişiyor, Ne Kadar Ediyor?24 Nis 2026

Bu içerik işinize yaradı mı?

Benzer içerikleri kaçırmamak için YouTube ve GitHub hesaplarımı takip edin.

YouTube GitHub

Haftalık Bülten

Her pazar özenle seçilmiş teknoloji yazıları doğrudan e-postanıza gelsin.

Etiket ajan değerlendirme Azure OpenAI CI/CD Copilot Agent Evaluations LLM judge Microsoft 365 Copilot regression test skor kartı
Önceki yazı

Azure SQL’de AI_GENERATE_EMBEDDINGS GA: T-SQL ile Vektör Devri

Sonraki yazı

Kubernetes v1.36’da DRA: Donanım Paylaşımında Yeni Dönem

İlginizi Çekebilir

Azure Cosmos DB Shell Artık Data Explorer İçinde
Aşkın KILIÇ 0

Azure Cosmos DB Shell Artık Data Explorer İçinde

04/10/2026
Azure Developer CLI 1.34: azure.yaml Katmanları ve
Aşkın KILIÇ 0

Azure Developer CLI 1.34: azure.yaml Katmanları ve

04/10/2026
Microsoft Circular Centers: Azure Donanımının İkinci Hayatı
Aşkın KILIÇ 0

Microsoft Circular Centers: Azure Donanımının İkinci Hayatı

03/10/2026

2 comments

comments user
Pınar H. 09/05/2026 17:40

Tam da ihtiyaç duyulan bir şey bu aslında, “demoda güzel görünüyor ama production’da ne olur?” sorusunun cevabını vermiş oluyorsunuz. Groundedness skoru özellikle ilgimi çekti, halüsinasyon sorunuyla boğuşan biri olarak bu metriği nasıl baseline olarak belirlediğinizi merak ettim.

comments user
Fatma B. 10/05/2026 02:31

Regression testlerini CI/CD’ye entegre etmek güzel bir yaklaşım ama pratikte bu skorların eşik değerlerini belirlemek sanırım en zorlu kısım oluyor. Groundedness için mesela %80 mi yeterli, %90 mı gerekli, bunu nasıl kalibre ediyorsunuz?

Yorumlar kapalı.

Yazı Ara

Takip Edin

  • Takipçi
  • Takipçi
  • Takipçi
  • Abone
  • Takipçi
  • Azure Cosmos DB Shell Artık Data Explorer İçinde
    04/10/2026 Azure Cosmos DB Shell Artık Data Explorer İçinde
  • Azure Developer CLI 1.34: azure.yaml Katmanları ve
    04/10/2026 Azure Developer CLI 1.34: azure.yaml Katmanları ve
  • Copilot Code Review: API Desteği ve Balanced Varsayılanı
    03/10/2026 Copilot Code Review: API Desteği ve Balanced Varsayılanı
  • GitHub App Installation Token'ları Artık 520 Karakter
    03/10/2026 GitHub App Installation Token’ları Artık 520 Karakter
  • Microsoft Circular Centers: Azure Donanımının İkinci Hayatı
    03/10/2026 Microsoft Circular Centers: Azure Donanımının İkinci Hayatı
  • 25 Dolar Altında Yapay Zeka Uygulaması mı? İşte Nasıl Yapılır!
    10/03/2026 25 Dolara Yapay Zeka Uygulaması Nasıl Yapılır?
  • 2026-03-10_15-35-23
    10/03/2026 Microsoft 365 E7: Yapay Zeka ve Güvenlik Bir Arada
  • Terminalde AI Ajanlarını Koddan Teste Taşımak: azd ile Gerçekten Yerel Deneyim
    18/03/2026 Terminalde AI Ajanlarını Koddan Teste Taşımak: azd ile Gerçekten Yerel Deneyim
  • DevOps Güncellemeleri
    09/03/2026 Azure DevOps Server Şubat Güncellemesi: Güvenlik
  • GitHub Copilot Pro Denemeleri Neden Durdu?
    11/04/2026 GitHub Copilot Pro Denemeleri Neden Durduruldu?
  • GitHub Copilot Pro Denemeleri Neden Durdu?
    11/04/2026 GitHub Copilot Pro Denemeleri Neden Durduruldu?
  • vcpkg'de Paralel Kurulum ve Güvenlik Yaması: Neler Değişti?
    06/04/2026 vcpkg’de Paralel Kurulum ve Güvenlik Yaması: Neler Değişti?
  • MCP Apps’i Kolaylaştıran Fluent API: Sahada Ne Değişiyor?
    08/04/2026 MCP Apps’i Kolaylaştıran Fluent API: Sahada Ne Değişiyor?
  • Yapay Zekâ Çağında Sanayi Politikası: Asıl Mesela Ne?
    06/04/2026 Yapay Zekâ Çağında Sanayi Politikası: Asıl Mesela Ne?
  • Microsoft Foundry Mart 2026: Sahadan İlk İzlenimler
    10/04/2026 Microsoft Foundry Mart 2026: Sahadan İlk İzlenimler

Hakkımda

Aşkın KILIÇ

Microsoft Azure Çözüm Uzmanı. Bulut bilişim, yapay zekâ, DevOps ve kurumsal güvenlik üzerine yazılar yazıyorum.

Devamını Oku →

Kategoriler

  • Azure
  • Bulut Altyapı
  • DevOps
  • Geliştirici Araçları
  • Güvenlik & Kimlik
  • Konteyner & Kubernetes
  • Kurumsal Teknoloji
  • Microsoft 365
  • Microsoft Azure
  • Veri & Analitik
  • Yapay Zeka

Popüler Etiketler

AI ajanları ASP.NET Core Azure azure app service Azure Cosmos DB Azure Developer CLI Azure DevOps Azure OpenAI azure sdk Azure SQL bulut bilişim CI/CD code review copilot Copilot CLI DevOps geliştirici verimliliği GitHub GitHub Actions GitHub Copilot güvenlik Kimlik Doğrulama Kubernetes Kurumsal geliştirme kurumsal güvenlik kurumsal yapay zeka maliyet optimizasyonu MCP Microsoft Agent Framework Microsoft Azure Microsoft Entra ID Microsoft Foundry otomasyon performans Pull Request RAG REST API SEO uyumlu verimlilik veri yönetimi Visual Studio Visual Studio 2026 VS Code yapay zeka Yazılım geliştirme
  • Gizlilik Politikası
  • Çerez Politikası
  • Kullanım Koşulları
  • Hakkımda
  • İletişim

© 2026 Aşkın KILIÇ | Tüm hakları saklıdır. | Powered By SpiceThemes

Çerez tercihleri Zorunlu çerezler sitenin çalışması için kullanılır. Analitik çerezler yalnız açık izninizden sonra Google Analytics ve Microsoft Clarity için etkinleştirilir. KVKK ve Çerez Politikası
✉

Haftalık Bülten

Azure, DevOps ve Yapay Zeka dünyasındaki en güncel içerikleri her hafta doğrudan e-postanıza alın.

Spam yok. İstediğiniz zaman iptal edebilirsiniz.
📱
Uygulamayı Yükle Ana ekrana ekle, çevrimdışı oku
Ana Sayfa
Kategoriler
💻 Geliştirici Araçları 469 yazı 🏗️ Bulut Altyapı 378 yazı 🤖 Yapay Zeka 314 yazı 🔧 DevOps 260 yazı ☁️ Microsoft Azure 254 yazı 🔒 Güvenlik & Kimlik 214 yazı 🏢 Kurumsal Teknoloji 96 yazı 📊 Veri & Analitik 66 yazı 🐳 Konteyner & Kubernetes 61 yazı 📧 Microsoft 365 22 yazı 📁 Azure 1 yazı
Ara
Popüler
Yapay Zeka Azure Kubernetes DevOps Copilot Docker
Paylaş
WhatsApp
İçindekiler
    ← Azure SQL’de AI_GENERATE...
    Kubernetes v1.36’da DRA: Donan... →
    📩

    Gitmeden önce!

    Her pazar özenle seçilmiş teknoloji yazıları ve AI haberleri doğrudan e-postanıza gelsin. Ücretsiz, spam yok.

    🔒 Bilgileriniz güvende. İstediğiniz zaman ayrılabilirsiniz.

    📬 Haftalık bülten: Teknoloji + AI haberleri
    Beni Takip Et Yeni Azure / AI / DevOps yazılarını GitHub ve RSS üzerinden takip edin.
    GitHub RSS