Azure Content Understanding GPT-5 Serisi: Model Seçimi ve
Azure Content Understanding, kurumsal içerikten (belge, görüntü, ses ve video) veri çıkarma ihtiyacı arttıkça model kataloğunu genişletiyor. Son güncellemeyle GPT-5 serisi desteği eklendi, grounding (kaynak eşleme) ve güven skoru (confidence) mekanizmaları yenilendi. Bu yazıda hangi modaliteye hangi modelin uygun olduğunu, yeni skorlama yönteminin ölçülen kazanımlarını ve karşılaştırmalı testlere nasıl başlanacağını Microsoft’un açıkladığı bulgular üzerinden özetliyorum.
Sürümle gelen yenilikler
Content Understanding artık GPT-5, GPT-5.1, GPT-5.2, GPT-5.4 ve GPT-5.5 serilerini; standart, mini ve nano varyantlarıyla birlikte belge, görüntü, video ve konuşma analizinde destekliyor. Genişleyen katalog, yüksek hacimli işlemlerde maliyet düşürmek isteyen ekiplere esneklik verirken ileri seviye akıl yürütme gereken senaryolarda üst modellere geçiş yolunu açık tutuyor.
Microsoft’un test ettiği yapılandırmalarda güncellenen grounding ve confidence yöntemi, toplam çıkarım (inference) token tüketimini %28’e kadar azaltıyor; tam çıkarım LLM maliyeti %25’e kadar düşerken confidence doğruluğu (AUROC ile ölçülen) %14’e kadar, grounding doğruluğu ise (exact match) %3’e kadar iyileşiyor.
Doğru modeli seçmek: bir karıştırıcı mantığı
Model seçimi iki fader’lı bir karıştırıcıya benzetilebilir: Bir tarafta içerik üzerindeki kalite, diğer tarafta uçtan uca maliyet. Formlarda öne çıkan bir model; video segmentasyonu, konuşma sınıflandırması veya görüntü üretiminde aynı üstünlüğü göstermeyebilir. Bu nedenle doğruluk, gecikme, throughput, uyumluluk ve bölgesel dağıtım gereksinimlerini birlikte değerlendirmek gerekiyor.
Modaliteye göre öneri tablosu
| Modalite | Dengeli seçim | En yüksek kalite | Düşük maliyetli seçim |
|---|---|---|---|
| Belge | GPT-5.1 veya GPT-5.2 | GPT-5.5: ~%2 daha iyi kalite, ~%101 daha yüksek maliyet | GPT-5.4 Mini: ~%50 daha ucuz, answer match’te ort. ~%2 düşük |
| Video | GPT-5 veya GPT-5.1 | Bu senaryoda dengeli seçimle aynı | GPT-5 Mini: GPT-5’e göre ~%28 daha ucuz, genel Generation F1’de ~%7 düşük |
| Konuşma | GPT-5.1 veya GPT-5.2 | GPT-5.5: GPT-5.2’ye göre ~%2 daha iyi, ~%101 daha yüksek maliyet | GPT-5.4 Mini: ~%48 daha ucuz, ~2 answer match puan düşük |
| Görüntü | GPT-5.1 | GPT-5.5: ~%3 daha iyi kalite, ~%130 daha yüksek maliyet | Sınıflandırma için GPT-5 Mini: GPT-5.1’e göre ~%52 daha ucuz, Classify F1’de ~%12 düşük |
Not: Konuşma ve belge çıkarımı benzer görev tipleri olduğundan Microsoft her ikisi için aynı model önerilerini kullanıyor.
Grounding: daha az token, aynı doğruluk
Güncellenen grounding sistemi, çıkarılan verinin kaynağını daha verimli tespit ediyor. Tüm model tiplerinde belge başına %20-30 daha az giriş token’ı ve %18-28 daha az toplam çıkarım token’ı gözlemlendi. Sıfır-örnekli (zero-shot) senaryoda güncellenen grounding, GPT-4.1 için token kullanımını %28, GPT-5.2 için %23 düşürdü.
Bu tasarruflar, test edilen model ve etiketli örnek kombinasyonlarında tam çıkarım LLM maliyetini %11-25 aralığında azaltırken P50 ve P95 gecikmesini de düşürdü. Grounding doğruluğu önceki yönteme yakın seviyede kaldı.
Confidence: daha doğru ve genellenebilir skorlar
Yeni confidence skorlama yöntemi daha geniş bir model yelpazesine uygulanabiliyor. AUROC ile ölçüldüğünde, yani doğru alanların yanlış alanların üstünde ne kadar tutarlı sıralandığına bakıldığında, yeni yöntem GPT-4.1 için ~%9, GPT-5.2 için ~%14 iyileşme sağlıyor.
Microsoft, GPT-5 Mini ve GPT-5 Nano ile confidence kalitesinde belirgin bir düşüş gözlediklerini not düşüyor. Confidence’a duyarlı akışlarda bu iki modelden kaçınmak öneriliyor. Skor dağılımı alan tipine göre değiştiği için straight-through processing (STP) senaryolarında kabul eşiklerini alan bazında belirlemek ve model değiştirildiğinde yeniden kalibre etmek gerekiyor.
Detay: kalite ve maliyet analizleri
Belgeler ve konuşma
Değerlendirme veri kümesi, yapılandırılmış, yarı yapılandırılmış ve yapılandırılmamış toplam 71 belge türünü kapsıyor. Content Understanding etiketli örneklerle veya örneksiz çalıştığından sıfır, bir, beş ve mevcut tüm etiketli örneklerle konfigürasyonlar test edilip ortalama alındı. Kalite; dizi ve nesne gibi konteyner alanlar hariç, yaprak alanlar ve analyzer’lar üzerinden macro average olarak raporlandı. Değerlendirilen belgelerin ortalama uzunluğu 3,35 sayfa. Konuşma için ayrı grafik yayımlanmadı; öneriler belge sonuçları üzerinden yapıldı.
Sonuçlarda GPT-5.1 ve GPT-5.2 kalite-maliyet dengesinde öne çıkıyor, aralarındaki answer match farkı yaklaşık %1. GPT-5.5, GPT-5.2’ye kıyasla ~%2 daha yüksek answer match sunarken tahmini ortalama maliyeti ~%101 artırıyor. GPT-5.4 Mini ise GPT-5.2’ye göre tahmini maliyeti ~%48 düşürürken answer match’ten ~%2 veriyor.
Video: en büyük model her zaman en iyisi değil
Video değerlendirmesi iki farklı yükü kapsıyor: 60 dakikalık, segmentasyon ağırlıklı bir veri kümesi ve ortalama bir dakikanın biraz altında kısa videolardan oluşan başka bir set. Generation F1 hem skaler yanıt alanlarını hem de logo görünme anı, haber segmenti süresi veya reklam arası gibi zaman damgalı özel segmentleri kapsıyor.
Ölçümlerde GPT-5 %89,0, GPT-5.1 %88,6, GPT-5.4 ise %87,5 genel Generation F1 elde etti. GPT-5 ve GPT-5.1 bu senaryoda hem dengeli hem en yüksek kalite çiftini oluşturuyor; GPT-5, GPT-4.1 baseline’ına göre yaklaşık %18 daha düşük maliyetle çalıştı. Daha ekonomik bir alternatif olan GPT-5 Mini, segmentasyon odaklı benchmark’ta GPT-5’e göre ~%28 daha ucuz; genel Generation F1’de ise ~%7 kayıp veriyor.
Görüntüler: sınıflandırma ve üretim için farklı modeller
Görüntü değerlendirmesi, beş tekrarla 17 zero-shot veri kümesi içeriyor; ürün, giyim, endüstriyel kusur, sahne ve nesne odaklı içerikleri kapsıyor. Sınıflandırma metriği F1, üretken alanlar ise 1-7 rubrik puanı olduğundan iki kalite ekseni tek bir kazanana indirgenmemeli.
Sonuçlarda GPT-5.1, sınıflandırmada %69,5 Classify F1 ile öne çıktı. Üretken görevlerde GPT-5.5, 7 üzerinden 5,0 puanla liderken GPT-5 Mini’ye kıyasla yaklaşık %3 daha yüksek kalite ~%375 daha yüksek maliyetle geliyor. Düşük maliyetli sınıflandırma için GPT-5 Mini, GPT-5.1’e göre ~%52 daha ucuz; buna karşılık Classify F1’de ~%12 düşük performans gösteriyor.
Sonraki adım: kendi iş yükünüzle test
Genişleyen katalog, karıştırıcının her kanalına daha geniş bir aralık tanıyor. Sıradaki adım, iş yükü için iki üç aday belirleyip aynı analyzer, şema, temsili girdi seti ve etiketli örneklerle test etmek. Yalnızca model deployment’ı değiştirilip çıktı kalitesi, gecikme, token kullanımı ve hata oranı karşılaştırılır. Testten önce analyzer’ın supportedModels yanıtını kontrol edip her adayın ilgili bölgede mevcut olduğundan emin olmak gerekiyor.
Content Understanding Studio ile başlangıç
Studio’da Settings menüsünden Foundry kaynağı eklenir ve varsayılan model deployment’ları yapılandırılır. Uygun bir varsayılan bulunmadığında Studio, gerekli modelleri otomatik olarak dağıtabiliyor. Ardından bir analyzer seçilip temsili içerikle çalıştırılır; çıkarılan alanlar, ham yanıt ve iş yükü için önemli olan kalite/gecikme/kullanım verileri kaydedilir.
REST API ile karşılaştırmalı testler
Yinelenebilir bir değerlendirme için her analyze isteğinde farklı bir modelDeployments eşlemesi geçirilebilir. İstek düzeyindeki eşleme, kaynak varsayılanlarını geçersiz kılar; böylece analyzer ve girdiler sabit tutulup yalnızca completion deployment’ı değiştirilebilir:
POST /contentunderstanding/analyzers/myInvoice:analyze
{
"inputs": [
{
"url": "<representative-input-url>"
}
],
"modelDeployments": {
"prebuilt-analyzer-completion": "<candidate-deployment-name>",
"prebuilt-analyzer-embedding": "<embedding-deployment-name>"
}
}
Aynı istek her aday için bir kez çalıştırılıp çıkarılan sonuçlar ve yanıttaki kullanım verileri karşılaştırılır. Dengeli öneriyle başlayıp düşük maliyetli seçenek eklenir; en yüksek kaliteli model ise ancak kalan doğruluk açığı iş akışı için gerçekten önemliyse dahil edilir.
Kaynaklar ve İleri Okuma
- devblogs.microsoft.com
- devblogs.microsoft.com
- devblogs.microsoft.com
- devblogs.microsoft.com
- devblogs.microsoft.com
- devblogs.microsoft.com
- devblogs.microsoft.com
- devblogs.microsoft.com
- Orijinal yazı: Azure Content Understanding GPT-5 Series Guide (Microsoft Foundry Blog)
- Content Understanding: Models and deployments (Microsoft Learn)
- Content Understanding Studio hızlı başlangıç
- Content Understanding REST API hızlı başlangıç
- Content Understanding Preview: yeni yetenekler özeti
- Azure Content Understanding Ağustos 2026: CU 1.0 GA ve CU
- Azure Content Understanding ile Belgeleri Akıllı İş Akışına Çevirmek
- Foundry’de Model, Maliyet ve Kaliteyi Nasıl Yönetiyorum?
- GPT-5.5 ve Microsoft Foundry: Kurumsal AI Artık Ciddi







Yorum gönder