Azure Document Intelligence mi Content Understanding mi?
Belge işleme çözümleri, her girdi aynı şablondan geldiğinde kolay görünür. Üretim ortamı ise nadiren bu kadar düzenlidir: faturalar farklı düzenlerde gelir, sözleşmelerde kritik bilgi düz metnin içine gömülüdür ve tek bir iş süreci PDF, Office belgesi, görüntü, ses ve video gibi birden çok biçimi kapsayabilir. Bu yazıda, Microsoft Foundry blogunda Chu Lahlou tarafından paylaşılan rehberi temel alarak Azure Document Intelligence (ADI) ile Azure Content Understanding (ACU) arasındaki mimari farkları, hangi iş yükünde hangisinin iyi bir başlangıç noktası olduğunu ve seçimi hangi ölçütlerle doğrulamanız gerektiğini ele alıyorum.
İki servis neyi paylaşıyor, nerede ayrışıyor?
Her iki servis de OCR ve düzen (layout) analizi gibi temel içerik çıkarımı yeteneklerini paylaşır. Ayrışma bu temelin üzerinde başlar:
- Azure Document Intelligence, sınıflandırma ve alan çıkarımı için özel eğitilmiş belge modelleri kullanır. Yapılandırılmış ve form odaklı belge işleme iş yüklerinde kendini kanıtlamış bir seçenektir.
- Azure Content Understanding, içerik çıkarımını generative AI yetenekleriyle birleştirir. Yüksek varyasyonlu veya yapılandırılmamış içerik, önceden etiketleme gerektirmeyen özel çıkarım, çıkarımsal (inferred) bilgi, akıl yürütme, RAG hazırlığı ve çok modlu içerik senaryolarında öne çıkar.
Kaynak rehberin altını çizdiği nokta şu: “her zaman şu servis daha iyidir” diyen evrensel bir kural yok. Mevcut bir ADI iş yükü üretim gereksinimlerini karşılıyorsa yerinde bırakılması öneriliyor. Content Understanding’i ise mevcut çözümün iyi karşılamadığı alanlara —yüksek belge varyasyonu, yapılandırılmamış çıkarım, akıl yürütme, RAG veya çok modlu içerik— genişlerken değerlendirmek mantıklı.
İş yükünden başlayın: sorulması gereken sorular
Yeni bir iş yükü için karar vermeden önce şu soruların yanıtı netleşmeli:
- İçerik yapılandırılmış mı, yarı yapılandırılmış mı, yoksa tamamen yapılandırılmamış mı?
- İstenen alanlar belgede açıkça yazıyor mu, yoksa çıkarım mı gerekiyor?
- Belge tipini ve gereken şemayı karşılayan olgun bir prebuilt model var mı?
- Temsil gücü yüksek, etiketlenmiş örnekler elinizde mi?
- Düzen, dil ve belge kaynakları arasında varyasyon ne kadar yüksek?
- İş yükü yalnızca belge mi içeriyor, yoksa görüntü, ses ve video da var mı?
- Dağıtım bulutta mı olacak, container mı gerekiyor, yoksa air-gapped bir ortam mı söz konusu?
- Kalite, gecikme, maliyet ve insan incelemesi için hangi eşikler sağlanmalı?
Senaryoya göre başlangıç noktası
| Senaryo | Önerilen başlangıç | Gerekçe |
|---|---|---|
| Üretim gereksinimlerini karşılayan mevcut ADI iş yükü | ADI ile devam | Kanıtlanmış bir akışta gereksiz değişiklikten kaçınmak |
| Yeni bulut iş yükü için OCR veya Layout çıkarımı | ACU prebuilt-read / prebuilt-layout |
Daha zengin yapısal çıktı, senkron ve asenkron API’ler, daha yüksek doğruluk, daha düşük gecikme ve Layout için sayfa başına daha düşük fiyatlandırma |
| Fatura, fiş, kimlik, vergi formu, mortgage formu gibi olgun prebuilt kapsamındaki standart belgeler | ADI prebuilt modeli veya ACU 2026-06-01-preview | Özel amaçlı prebuilt modeller benzer doğrulukta maliyet avantajını koruyor; preview kullanmaya açık ekipler Advanced Contextualization ile prebuilt analyzer’ları deneyebilir |
| Etiketlenmiş örneği olmayan özel çıkarım | ACU custom analyzer | Generative AI’ın dünya bilgisinden yararlanan zero-shot alan çıkarımı |
| Etiketli örnekleri bulunan, yüksek oranda yapılandırılmış özel formlar | ADI custom model | Özel belge modelleri metin ve düzen bilgisini birlikte kullanarak yüksek doğruluk sağlıyor |
| Yüksek varyasyonlu veya yapılandırılmamış özel çıkarım | ACU custom analyzer | Yapılandırılmamış belge anlama için generative yaklaşım uygun |
| Çıkarım, mutabakat, hesaplama veya çok adımlı akıl yürütme gerektiren alanlar | ACU custom analyzer | Belge kanıtları üzerinde generative ve agentic analiz desteği |
| RAG’e hazır belge ön işleme | ACU RAG analyzer | Yapı farkındalıklı Markdown ve erişim odaklı çıktı, daha iyi kalite ve daha düşük maliyetle |
| Görüntü, ses, video veya karma medya işleme | ACU | Belge, görüntü, ses ve video modaliteleri genelinde yapılandırılmış bilgi çıkarımı |
| Şirket içi veya air-gapped işleme | ADI containers | Container dağıtım seçeneği sunması |
Kaynak, bu önerilerin yayın tarihindeki API sürümlerine dayanan iç kıyaslamaları yansıttığını belirtiyor. Yani tabloyu bir başlangıç filtresi olarak kullanıp kendi temsili içeriğinizle doğrulamanız öneriliyor.
Yetenekler neden örtüşüyor?
Her iki servis de belge OCR’ı, düzen analizi ve alan çıkarımı yapabilir. Fatura, fiş, kimlik belgesi, vergi belgesi ve mortgage belgesi gibi bazı belge tiplerinde iki portföyde de ilgili yetenekler bulunuyor. Ancak örtüşme, uygulamaların aynı şekilde davrandığı anlamına gelmiyor.
Pratik yaklaşım şöyle özetlenebilir: ADI prebuilt fatura modelinin yerleşik şeması ve kalitesi iş ihtiyacını karşılıyorsa onu kullanın. Akış ciddi biçimde özelleştirilmiş bir şema, girdiler arasında daha yüksek varyasyon, çıkarımsal değerler veya doğrudan çıkarımın ötesinde akıl yürütme gerektiriyorsa ACU analyzer’ını değerlendirin. İkisi de uygun görünüyorsa aynı temsili belge kümesi üzerinde karşılaştırın.
Mevcut rehberlik, başarılı ADI iş yüklerinin taşınmasını şart koşmuyor. API’ler, uç noktalar, SDK’lar ve faturalandırma ayrı kaldığı için ekipler Content Understanding’i yalnızca fayda sağlayacağı yeni senaryolarda seçici biçimde devreye alabiliyor.
Ortak temel, farklı çıkarım yaklaşımları
OCR ve belge düzeni
Her iki servis de ham belge içeriğini metne ve sayfa, paragraf, tablo, şekil, seçim işareti, koordinat gibi yapısal öğelere dönüştürür. Bu tür işlemler için yeni bulut iş yüklerinde Content Understanding öneriliyor.
ACU belge çıktısı; yapıyı koruyan Markdown’ın yanında kelimeler, paragraflar, bölümler, formüller, tablolar, şekiller, imzalar, köprüler, barkod, QR kod, açıklamalar, meta veri ve sayfa düzeyi bilgiyi içerebiliyor. Desteklenen öğe ve dosya tipi listesinin iş ihtiyaçlarıyla büyümeye devam ettiği belirtiliyor.
prebuilt-read ve prebuilt-layout analyzer’ları özel OCR ve layout modelleri kullanır; dil modeli veya embedding modeli gerektirmez ve deterministik sonuç üretir. prebuilt-read temel OCR sağlarken prebuilt-layout daha zengin düzen ve yapı çıkarımı ekler.
Alan çıkarımı: asıl mimari fark
Document Intelligence, amaca yönelik eğitilmiş belge modelleri kullanır. Bu modeller formlardaki görsel ve iki boyutlu ilişkileri —etiketler, değerler, satırlar, sütunlar, tekrarlayan yapılar— öğrenir. Şu durumlarda güçlü bir uyum sağlar:
- Belge yapısı sabit ya da sınırlı bir aralıkta değişiyorsa,
- Aranan değerler belgede açıkça yer alıyorsa,
- Özel model eğitimi için temsili etiketli örnekler varsa,
- Tutarlı ve tekrarlanabilir sonuç öncelikliyse.
Content Understanding ise şema tabanlı alan çıkarımı için generative modeller kullanır. Şu koşullarda faydalıdır:
- Düzenler ve diller belirgin biçimde değişiyorsa,
- Belgeler yarı yapılandırılmış veya yapılandırılmamışsa,
- Alanlar sabit görsel konum yerine anlamla tanımlanıyorsa,
- Yanıtların birden fazla pasajdan çıkarılması veya sentezlenmesi gerekiyorsa,
- Eğitim kümesi etiketlemeden başlamak istiyorsanız,
- Bilgi şekillerden, grafiklerden veya diğer görsel içerikten gelmeliyse.
ACU; metin, düzen, görsel yapı, şema tanımları ve diğer belge sinyallerini birleştirerek çıkarımı temellendirir (grounding). Bir alan şemasıyla başlayıp zor vakalar için sonradan etiketli örnekler veya bilgi kaynakları ekleyebilirsiniz. Generative alanlar dahil belge alanları için güven skoru ve kaynak temellendirme mevcut; tarih ve sayı gibi desteklenen tipli değerler kanonik biçimlere normalize ediliyor.
Content Understanding 2.0 preview ile birlikte iki yetenek öne çıkıyor: birden fazla etiketli örnekten öğrenerek her alanın en verimli ve güvenilir biçimde nasıl çıkarılacağını belirleyen advanced contextualization ve daha karmaşık çıkarım görevleri için yinelemeli akıl yürütme döngüsü kullanan agentic mode.
Yaygın iş yükü desenleri
Standart formlar
Vergi formları, sabit mortgage başvuruları, pasaportlar, kimlik belgeleri ve kuruma özel başvuru formları. Gereken belge tipini ve alanları karşılayan bir ADI prebuilt modeli varsa oradan başlayın. Özel ama çok kararlı bir form söz konusuysa ADI custom model etiketli örneklerden öğrenebilir. Şema mevcut prebuilt’ten belirgin biçimde ayrışıyorsa, sonuç çıkarımsal bilgi içeriyorsa veya etiketsiz başlamak önemliyse ACU’yu değerlendirin.
Az sayıda bilinen varyant
Birkaç bölgeden gelen sigorta hasar dosyaları, farklı departmanların masraf raporları, bilinen bir program kümesinden başvurular, yıllık form revizyonları. Her iki yaklaşım da uygulanabilir olabilir: düzenler sınırlıysa ve etiket mevcutsa ADI; hızlı şema iterasyonu veya etiketsiz başlangıç daha önemliyse ACU.
Yüksek varyasyonlu, yarı yapılandırılmış belgeler
Çok sayıda tedarikçiden faturalar, uluslararası fişler, farklı satıcılardan satın alma siparişleri, irsaliyeler, çok sayıda kurumdan transkriptler. Kararı yalnızca belge kategorisine bakarak vermeyin. ADI prebuilt’i gereken şemayı kapsıyor ve tüm dağılımda iyi çalışıyorsa en basit çözüm olarak kalabilir. Şema işe özgüyse, varyasyon yüksekse veya etiket yoksa ACU custom analyzer ile başlayın.
Yapılandırılmamış belgeler
Sözleşmeler, yatırım raporları, araştırma makaleleri, politikalar, sevk mektupları ve anlatısal iş kayıtları. Bilgi düz metinle ifade ediliyorsa, bölümlere dağılmışsa veya sabit bir konumdan kopyalanmak yerine çıkarım gerektiriyorsa ACU genellikle daha iyi başlangıç noktası. Hukuki anlaşmalar için ACU hazır bir sözleşme (contract) analyzer’ı sunuyor; custom analyzer ile şema sürece göre uyarlanabiliyor.
Akıl yürütme ağırlıklı analiz
Finansal belgelerde toplamların mutabakatı, doğrudan belirtilmeyen değerlerin hesaplanması, iç tutarlılık kontrolü, belirli koşulların sağlanıp sağlanmadığının değerlendirilmesi, aynı dosyadaki sözleşme ile ek sözleşmelerin ilişkilendirilmesi, tablo-şekil-metin kanıtlarının birleştirilmesi. Bu senaryolarda ACU agentic mode değerlendirilebilir; çok adımlı akıl yürütme, hesaplama, doğrulama, görsel analiz ve şemaya hizalı yapılandırılmış çıktı destekliyor. Kaynak, agentic mode’un düz alan çıkarımında varsayılan olarak değil, standart çıkarımın yetersiz kaldığı karmaşık analizlerde kullanılmasını öneriyor. Agentic mode şu an preview aşamasında.
Karma medya ve RAG
PDF ve kimlik görüntüleri içeren işe alım paketleri, sözleşme ve çağrı transkriptlerinden oluşan uyum dosyaları, form-not-görüntü-ses karışımı hasar dosyaları veya bilgi erişimi senaryoları. ACU; görüntü, ses ve video için analyzer’lar sunarak her modalite için ayrı çıkarım hattı kurma ihtiyacını azaltıyor. RAG analyzer’ları ise düzen farkındalıklı Markdown çıkarıyor, şekil ve grafikleri analiz ediyor, özet üretiyor ve embedding ile indeksleme için parçalı (chunked) çıktı oluşturuyor.
Read ve Layout tarafına yakın bakış
İki servisin en doğrudan örtüştüğü alan Read (OCR) ve Layout. Yeni bulut tabanlı OCR ve Layout iş yüklerinde önce ACU’nun prebuilt-read ve prebuilt-layout analyzer’larını değerlendirmek öneriliyor.
Document Intelligence Layout ise şu durumlarda uygun kalmaya devam edebilir:
- Zaten devrede ve gereksinimleri karşılıyorsa,
- İhtiyaç duyulan yetenek onun yanıt yapısına veya entegrasyonuna özgüyse,
- İş yükü mevcut ADI operasyonel karakteristiklerine bağımlıysa,
- Container dağıtımı gerekiyorsa,
- Servis limitleri veya desteklenen girdiler o iş yükü için ADI lehineyse.
Yayımlanan fiyatlar, limitler, desteklenen öğeler ve preview yetenekleri değişebileceği için güncel fiyatlandırma ve servis limiti dokümantasyonunu karşılaştırmak gerekiyor; ilgili bağlantıları yazının sonundaki bölümde bulabilirsiniz.
Başarıyı tam metin eşleşmesiyle değil, iş sonucuyla ölçün
Tekrarlanabilirlik operasyonel açıdan değerlidir ama doğrulukla aynı şey değildir. Bir sistem tutarlı biçimde yanlış değeri döndürebilir; buna karşılık iki doğru çıktı yalnızca biçim olarak farklılaşabilir. Örneğin bir tarih şu biçimlerde görünebilir:
- January 1, 2025
- 1/1/2025
- 2025-01-01
Tam metin eşleştirmesi bunları farklı sayabilir, oysa iş değeri aynıdır. Content Understanding, desteklenen tipli alanları —tarih ve sayı dahil— otomatik olarak kanonik değerlere normalize ediyor.
Bu nedenle karşılaştırmayı iş süreciyle bağlantılı metriklerle yapmak öneriliyor: alan düzeyinde anlamsal doğruluk, gereken normalizasyon ve doğrulama, hata ve istisna oranları, insan inceleme oranı, uçtan uca otomatik işleme (straight-through processing) oranı, sınıflandırma ve yönlendirme doğruluğu, gecikme, toplam maliyet, operasyonel güvenilirlik ve çözümü kurup sürdürmek için gereken efor.
Fatura akışında başarı, tutarların mutabık olması ve belgelerin doğru yönlendirilmesi anlamına gelebilir; sözleşme akışında ise tarafların, tarihlerin, yükümlülüklerin ve yetkili hukukun doğru tespiti. Testleri zor vakalar ve üretimde beklenen varyasyonu içeren temsili belgelerle yapın; yalnızca ortalama doğruluk, belirli belge tiplerindeki ciddi hataları gizleyebilir.
Sahadan bir örnek: FinHero
Malezya merkezli fintech FinHero, AI destekli finansal altyapı, belge zekâsı ve alternatif veri yetenekleri geliştiriyor. Şirket, belge işleme hatlarında hem Document Intelligence hem de Content Understanding kullanıyor ve yaklaşımı belge tipine ve iş gereksinimine göre seçiyor.
Fiş değerlendirmesi, kararın neden iş yüküne özgü olması gerektiğini gösteriyor: yaygın standart fiş formatlarında ADI prebuilt’leri iyi çalışabiliyor, bilinen varyantlar için eğitilmiş bir custom model tutarlı çıkarım sağlayabiliyor; gömülü indirimler, iç içe ek ürünler, yuvarlama düzeltmeleri ve servis ücreti gibi kavramlar içinse ACU custom analyzer ile özel bir şema tanımlanabiliyor. Ekip, bu şemayı maliyet açısından verimli bir model yapılandırmasıyla eşleştirerek ihtiyaç duyduğu dengeyi kurmuş: yüksek kaliteli çıkarım ve veri gereksinimlerine uyarlanmış maliyet-etkin işleme.
“Azure Document Intelligence ve Azure Content Understanding, FinHero’ya finansal belgelerin yüksek kaliteli çıkarımını ve yapılandırılmasını otomatikleştirmek için güçlü bir temel sağladı; Azure’ın daha geniş bulut platformu ise düzenlemeye tabi finansal hizmetlerde ihtiyaç duyduğumuz ölçeklenebilirlik, güvenlik ve güvenilirliği destekliyor. Microsoft’un teknolojisi ve desteğiyle FinHero, Malezya’nın ilk AI ve bulut-native Kredi Raporlama Kuruluşlarından biri olma yolunda ilerliyor.”
— Top Lim, CEO & Kurucu Ortak, FinHero
Önerilen karar süreci
- Çalışan ADI iş yüklerini yerinde bırakın. Yeniden değerlendirmeyi, başka bir servisin örtüşen yetenekleri olduğu için değil, iş yükü veya iş gereksinimleri değiştiğinde yapın.
- Uygun bir prebuilt var mı kontrol edin. Belge popülasyonunu ve gereken şemayı karşılayan yerleşik bir prebuilt varsa onu tercih edin.
- İş yükü karakteristiğiyle kısa liste oluşturun. Yapı, varyasyon, etiket durumu, çıkarım, akıl yürütme, modalite, dağıtım, gecikme ve maliyeti birlikte değerlendirin.
- Temsili girdilerle prototip kurun. Yaygın belgeleri, zor vakaları ve üretimde beklenen varyasyonu dahil edin.
- İş düzeyinde sonuçları ölçün. Alt akış doğrulaması, istisna yönetimi, insan incelemesi, güvenilirlik ve toplam işletme maliyetini birlikte takip edin.
- Gerektiğinde belge tipi başına seçim yapın. Aynı iş süreci içinde farklı belge tipleri farklı yaklaşımları haklı çıkarabilir.
Özetle: iki servis arasındaki seçim bir “kazanan belirleme” egzersizi değil, iş yükü eşleştirme egzersizi. Yapı ve etiket varsa ADI’nin özel belge modelleri güçlü; varyasyon, çıkarım, akıl yürütme, RAG ve çok modlu içerik devreye girdiğinde ACU’nun generative yaklaşımı avantajlı. Kararı aynı temsili belge kümesi üzerinde ölçerek vermek, mimari tartışmasından daha belirleyici.
Kaynaklar ve İleri Okuma
- Azure Document Intelligence and Azure Content Understanding: a practical guide (Chu Lahlou, Microsoft Foundry Blog)
- Microsoft Learn: Doğru AI aracını seçme rehberi
- Content Understanding prebuilt analyzer’lar
- Content Understanding agentic mode
- Content Understanding belge öğeleri (Layout çıktısı)
- Content Understanding: Yenilikler
- Content Understanding fiyatlandırma açıklaması
- Azure Content Understanding fiyatlandırma sayfası
- Document Intelligence Layout modeli
- Azure AI Document Intelligence fiyatlandırma sayfası
- Microsoft Foundry portalı
- Content Understanding portalı
- Azure Content Understanding ile Belgeleri Akıllı İş Akışına Çevirmek
- Azure Content Understanding: İçerik Çıkarımı Neden Kritik
- Azure Content Understanding: CU 1.0 GA gelişmeleri







Yorum gönder