Azure Content Understanding: İçerik Çıkarımı Neden Kritik
Microsoft Foundry ekibinden Chu Lahlou ve Cha Zhang, büyük dil modelleri çağında “içerik çıkarımı” (content extraction) katmanının neden hâlâ gerekli olduğunu anlatan bir yazı dizisine başladı. Serinin ilk yazısının ana tezi net: kurumsal yapay zekânın başarısını seçtiğiniz model değil, ajanlarınızın üzerinde işlem yaptığı içeriğe güvenip güvenemeyeceğiniz belirliyor. Bu yazıda o tezin gerekçelerini, Azure Document Intelligence ile Azure Content Understanding arasındaki iş bölümünü ve Microsoft’un açıkladığı yatırım başlıklarını derledim.
Soru neden sürekli geri geliyor?
Yaygın varsayım şu: modeller güçlendikçe ayrı bir çıkarım katmanına gerek kalmaz. Yazarlar tam tersini savunuyor. Kurumlar AI ajanlarına ne kadar bağımlı hale gelirse, altındaki içeriğin o kadar güvenilir, yapılandırılmış ve denetlenebilir olması gerekiyor. Aksi halde her ajan kararı, kaynak materyalin belirsizliklerini ve sınırlarını miras alıyor. Yazıdaki ifadeyle: daha iyi modeller mümkün olanın tavanını yükseltir, ancak doğru olması gereken zemini ortadan kaldırmaz.
LLM tabanlı prototipler üretime taşınırken tanıdık bir örüntü ortaya çıkıyor. Ekip, belge deposunun üzerine bir sohbet arayüzü kuruyor ve sonuçlar umut verici oluyor. Koleksiyon yüzlerce sayfadan milyonlarca sayfaya büyüdüğünde ise yeni gereksinimler devreye giriyor: öngörülebilir maliyet, tutarlı gecikme, karmaşık içeriğin güvenilir şekilde işlenmesi ve kaynağına kadar izlenebilen yanıtlar. Denetim ekibi de tek başına modelin güvenilir biçimde cevaplayamayacağı bir soru soruyor: Bu yanıt nereden geliyor ve ne kadar eminiz?
Cazip sonuç “daha akıllı bir modele ihtiyacımız var” demek. Yazının işaret ettiği daha zor gerçek ise şu: içerik çıkarımı kendi başına bir mühendislik disiplini; ham baytları yapılandırılmış, temellendirilmiş (grounded) ve doğrulanabilir girdilere dönüştürme işi. Ve üretimdeki generative AI sistemlerinin en sık hata yaptığı katman da burası.
Çıkarımı doğrudan LLM üzerine kurmak neye mal oluyor?
Yazarlar, ekibin çıkarımı doğrudan bir LLM üzerine inşa ettiği senaryoyu adım adım anlatıyor. İlk prompt genelde işin kolay kısmı; gerçek dünya içeriği ve üretim gereksinimleri girdikçe iş büyüyor:
- Prompt ile başlıyorsunuz; ilk yirmi belge için yeterli oluyor.
- Ardından PDF, TIFF, DOCX, taranmış dosyalar ve her biri farklı ayrıştırma davranışına sahip format varyasyonlarıyla karşılaşıyorsunuz.
- Sayfa sayısı ve bağlam penceresi sınırları bir chunker yazmayı zorunlu kılıyor; görsel ağırlıklı dosyalarda gömülü görselleri ayrı mı işleyeceğiniz, yoksa her sayfayı görsel olarak mı render edeceğiniz (token kullanımını şişirmeden) kararını vermeniz gerekiyor.
- Model tablo yapısını korumadığında bir layout parser ekliyorsunuz.
- Prompt mühendisliği, sürekli büyüyen bir talimat ve istisna kütüphanesine dönüşüyor.
- Çok sayfalı ilişkiler — örneğin 12. sayfadaki bir toplamın 4. sayfadaki bir satır kalemine atıf yapması — ayrı bir geçiş gerektiriyor.
- Denetim için alan bazında güven skoru ve grounding; tarih, para birimi ve taraf adları için normalizasyon; modelin güvenilir işleyemediği sayfalar için hata yönetimi geliyor.
- Kısa sürede token optimizasyonu, değerlendirme (evaluation) altyapısı, güvenilirlik, ölçeklenebilirlik ve üretimde çalışmak için gereken güvenlik/uyumluluk kontrolleri de sizin sorumluluğunuza giriyor.
Her bir sorun tek başına yönetilebilir. Bir araya geldiklerinde ise ekibinizin sahiplenmek, işletmek ve her yeni model çıktığında yeniden benchmark etmek zorunda olduğu bir platform ortaya çıkıyor.
Yazarlar bunu tamamen reddetmiyor: problem dar kapsamlıysa, belge formatlarınız stabilse ve tüm sistemi sahiplenmekten rahatsız değilseniz kendiniz inşa etmek geçerli bir seçim. Modern LLM’ler ve kodlama ajanları bunu her zamankinden kolay hale getiriyor. Yine de çalışan bir demo ile kurumsal seviyede bir platform arasındaki fark hâlâ belirgin. Yönetilen çıkarım servislerinin adreslediği konular, prototipten sonra ortaya çıkanlar: ölçek, güvenilirlik, grounding, güven skoru, yönetişim, uyumluluk, güvenlik, maliyet ve her sürümde yeniden entegrasyon gerektirmeyen model yeniliği.
Tek portföy, birbirini tamamlayan iki yaklaşım
Microsoft’un bu alandaki çalışması generative AI dalgasından önceye dayanıyor. Bulut tabanlı belge işleme henüz yeni bir kategoriyken ortaya çıkan Azure Form Recognizer, bugün Foundry Tools içinde Azure Document Intelligence olarak konumlanıyor. Patentli Custom Template teknolojisi, az sayıda etiketli örnekten tekrarlanabilir belge yapılarını öğrenmek için random forest kullanıyordu ve geliştiricilere kendi formlarından çıkarımı otomatikleştirmenin pratik bir yolunu veriyordu.
Bir sonraki büyük adım Azure Document Intelligence’taki Custom Neural oldu. Bu evrimi mümkün kılan gelişme, Microsoft Research Asia’nın öncülük ettiği LayoutXLM ile örneklenen çok modlu belge anlama araştırmalarıydı. LayoutXLM; metin, düzen (layout) ve görsel bilgiyi birlikte modelleyerek görsel açıdan zengin belgeleri diller arası anlamayı hedefliyor. Bu ilerlemeler, tekrarlanabilir şablonların ötesine geçip belge yapısı ve görünümündeki varyasyonlara daha iyi genelleme yapmayı mümkün kıldı. Read, Layout ve prebuilt modellerle birlikte Azure Document Intelligence’ı yüksek doğruluklu, amaca özel belge işleme için olgun bir platform haline getirdi.
Foundation model’lerdeki hızlı ilerleme ise bir sonraki eşiği açtı. LLM’lerin getirdiği geniş bilgi ve akıl yürütme yeteneği, yüksek kaliteli içerik çıkarımını generative AI ile birleştirme ve klasik belge işleme modellerinin tek başına çözemediği problemlere yönelme fırsatı yarattı. Foundry Tools içindeki Azure Content Understanding, bu evrimi belgelerin ötesine taşıyor: belge, görüntü, ses ve videoda içerik çıkarımını generative analiz ve akıl yürütmeyle birleştiriyor. Yapılandırılmamış çok modlu içeriği; otomasyon, analitik, arama ve ajan tabanlı iş akışları için kullanıcı tanımlı yapılandırılmış çıktılara dönüştürüyor.
İkisi arasındaki iş bölümü
Her iki servis teknik temelin bir kısmını paylaşıyor, ancak farklı yaklaşımlar kullanıyor ve farklı senaryolar için optimize edilmiş durumda:
- Azure Document Intelligence: Amaca yönelik eğitilmiş, yapılandırılmış belge çıkarımı sunuyor. Bilinen belge türleri ve yapılarından yüksek doğruluklu çıkarım için olgun bir tercih; vergi formları, kimlik belgeleri, fişler, faturalar ve benzeri belge işleme senaryoları bu kapsamda.
- Azure Content Understanding: Yüksek kaliteli içerik çıkarımının üzerine şema tabanlı alan analizi, çok modlu içerik işleme ve akıl yürütme için generative AI ekliyor. Belge, görüntü, ses ve videoda çalışıyor; yapılandırılmış çıkarımdan aramaya, analitikten ajan tabanlı uygulamalara uzanan senaryoları destekliyor. Analizörleri; içerik çıkarımı, bağlamlandırma, grounding ve güven sinyalleri ile Foundry modellerini birleştirerek uygulamanın tanımladığı yapılandırılmış çıktıyı üretebiliyor.
Yazarlara göre iki servisin birlikte var olmasının nedeni bu tamamlayıcılık; birçok üretim sistemi ikisini birlikte kullanmaktan fayda görebilir. Serinin ilerleyen yazılarında alttaki teknolojilerin daha derin incelemesi ve senaryo bazlı seçim rehberliği paylaşılacağı belirtiliyor.
Azure Content Understanding’in yönü ve beş yatırım alanı
Microsoft, Azure Content Understanding’i beş pratik kritere göre ölçtüğünü söylüyor: kalite, maliyet, gecikme, öngörülebilirlik ve kurumsal hazırlık. Dağınık düzenler, karışık modaliteler ve akıl yürütme ağırlıklı alanlar gibi yapılandırılmamış ve yarı yapılandırılmış içeriğin büyük bölümünde servisin geleneksel çıkarım hatlarından daha iyi sonuç verdiği ifade ediliyor. Müşterilerin öne çıkardığı noktalar olarak şunlar sıralanıyor: yapılandırılmamış içerikte daha yüksek kalite, daha basit analizör tasarımı, yerel çok modlu destek, alan bazında grounding ve güven skoru, ve her sürümde yeniden entegrasyon yapmadan foundation model ilerlemelerini benimseyebilme.
Yatırım gereken alanlar konusunda da açık bir dil kullanılıyor. Azure Document Intelligence, iki boyutlu düzenleri ve uzamsal ilişkileri anlayan göreve özel modeller sayesinde yüksek düzeyde yapılandırılmış belge senaryolarında öne çıkmaya devam ediyor. Hedef, amaca özel belge çıkarımının güçlü yanları ile generative AI’ı birbirine yaklaştırmak; Content Understanding tarafında daha yüksek kaliteli ve daha zengin belge anlama sunarken model maliyetini düşürmek ve kurumsal üretim için model seçimini basitleştirmek.
Serinin devamında ele alınacağı belirtilen beş başlık şöyle:
- Prebuilt analizörler için Advanced Contextualization: Sektöre özel yeni hazır çözümlerde kalite ve maliyet verimliliğini iyileştiriyor.
- Agentic mode: Karmaşık belgelerde çok adımlı problemler üzerinde akıl yürüten, araç kullanan iş akışlarını destekliyor.
- Senkron Read ve Layout API’leri: Çağıranın asenkron polling yönetmesini gerektirmeden sonuç dönduruyor; desteklenen girdilerde daha hızlı ve yanıt veren deneyimler sağlıyor.
- Platform ve framework entegrasyonları: Foundry IQ, Microsoft Agent Framework, LangChain, MarkItDown ve Azure Content Understanding CLI ile entegrasyon sayesinde çıktı, ekiplerin zaten kullandığı hatlara akıyor.
- AI yönetişimi ve kurumsal hazırlık: Gizlilik, güvenlik ve sorumlu AI merkezde. Grounding, güven skorları ve dinamik human-in-the-loop akışları, güvenilir olmayan model çıktısını tespit edip incelemeye yardımcı oluyor.
Güncel kullanılabilirlik ve sınırlamalar için Microsoft, Azure Content Understanding’in “What’s new” sayfasına bakılmasını öneriyor.
Öne çıkarılan on bir senaryo
Yazıda, bu yatırımların açtığı ve ilk bakışta “içerik çıkarımı” gibi görünmeyebilecek senaryolar da listeleniyor:
- Belge düzenine ve alan terminolojisine dayalı özel çeviri: “Bu paragrafı çevir”in ötesine geçip numaralı maddeleri, tanımlı terimleri ve hukuk incelemecisinin onay için ihtiyaç duyduğu güven bilgisini koruyarak sözleşme çevirmek.
- Çok modlu arama ve bilgi madenciliği: Görüntüleri, video karelerini ve ses transkriptlerini metinle aynı sorgulanabilir, temellendirilmiş alan yapısına dönüştürerek karışık medya arşivleri üzerinde tek bir erişim indeksi kurmak.
- Grafik, şekil ve tablolardan içgörü: Finansal beyanları, bilimsel raporları ve mühendislik çizimlerini ajanın akıl yürütebileceği yapılandırılmış veriye çevirmek.
- Denetim seviyesinde çıkarım: Alan bazında grounding ve güven skoruyla sigorta talepleri, vergi beyanları ve sağlık kabul süreçleri gibi regüle iş akışlarını desteklemek; “ne yazıyor” kadar “nereden biliyoruz ve ne kadar eminiz” sorusuna da yanıt vermek.
- Kısa video klipleri ve görüntülerde güvenlik izleme: Görsel kanıtlar arasında ilgili olayları tespit edip özetlemek ve güvenlik ekiplerinin inceleyebileceği yapılandırılmış bulgular üretmek.
- Sigorta hasar triyajı: Formları, fotoğrafları, keşif tutarlarını ve destekleyici belgeleri birleştirerek eksik bilgiyi tespit etmek, kilit olguları çıkarmak ve dosyayı incelemeye yönlendirmek.
- Mortgage ve kredi değerlendirmesi: Başvuru paketlerinde gelir, istihdam, varlık ve yükümlülükleri çapraz kontrol ederek tutarsızlıkları yüzeye çıkarmak.
- Üretimde olay analizi: Olay raporları, görüntüler, video, bakım kayıtları ve sensör bağlamını ilişkilendirerek olayları yeniden kurgulamak ve katkıda bulunan faktörleri öne çıkarmak.
- Tedarikçi onboarding: Başvurular, vergi formları, sertifikalar ve uyumluluk belgeleri arasında bilgi çıkarıp doğrulayarak kurulum ve istisna yönetimini hızlandırmak.
- Sözleşme incelemesi: Kilit hükümleri, yükümlülükleri, sapmaları ve riskleri belirlerken her bulguyu kaynak metne dayandırmak.
- Çağrı merkezleri: Konuşma sesini, süpervizör, uyumluluk ve koçluk akışlarına beslenen yapılandırılmış içgörülere çevirmek.
Bu senaryoların ortak gereksinimi yalnızca içeriği okumak değil; uygulamalara ve ajanlara kullanabilecekleri bilgiyi, insanlara da bu bilgiyi doğrulayabilecekleri bir yolu vermek. Yazının kapanış argümanı da bu: modeller güçlense de içerik çıkarımı temel katman olmayı sürdürüyor.
Nereden başlanır?
Microsoft’un önerdiği yol şu: Azure Content Understanding genel bakış dokümanını inceleyip Microsoft Foundry portalında hazır bir analizörü denemek ya da Content Understanding Studio’da özel bir analizör oluşturmak. Yapılandırılmış belge senaryoları içinse Azure Document Intelligence genel bakışını okuyup Document Intelligence Studio üzerinde deneme yapmak. Serinin bir sonraki yazısında, iki servisin doğrudan LLM kullanımıyla karşılaştırmasının ele alınacağı belirtiliyor.
Kaynaklar ve İleri Okuma
- Why content extraction still matters in the GenAI era — Microsoft Foundry Blog (orijinal yazı)
- Azure Content Understanding genel bakış
- Azure Content Understanding: What’s new (kullanılabilirlik ve sınırlamalar)
- Azure Document Intelligence genel bakış
- LayoutXLM araştırma yayını — Microsoft Research
- Microsoft Foundry portalı
- Content Understanding Studio
- Document Intelligence Studio
- Microsoft Foundry Blog RSS akışı
- Azure Content Understanding ile Belgeleri Akıllı İş Akışına Çevirmek
- Azure Content Understanding ve GPT-5 serisinde model seçimi







Yorum gönder