AI Maliyet Optimizasyonu: ROI’yi Gerçekten Artırmanın Yolu
Şöyle söyleyeyim, Geçen ay bir finans kuruluşunda FinOps toplantısındaydım. CTO masaya bir grafik koydu — Azure OpenAI harcamaları son 4 ayda %340 artmış. O an oda bir tuhaf öldü. Herkes birbirine baktı. “AI kullanıyoruz, süper” dönemi bitti artık. Şimdi herkes aynı şeyi soruyor: “Peki bu harcamanın karşılığını alıyor muyuz?”
📋 İçindekiler
-
Şöyle söyleyeyim, Az önce “en dayanıklı modeli seçin” gibi bir şey ıma ettim. Aslında tam tersi doğru — en küçük yeterli modeli seçin. Bu prensip altın değerinde değil, daha çok sessiz sedasız para kurtarıyor; hani ilk bakışta heyecan vermiyor. Ay sonunda tabloyu görünce insanın fikri değişiyor.
2. Geliştirme ve Test
Development ortamında production seviyesinde kaynak ayırmayın. Bunu söylemek kolay, uygulamak zor. Çünkü geliştiriciler “ama test sonuçları farklı çıkar” diyor; haklılar, fakat dev ortamında A/B test yapmıyorsunuz ki, burada iş biraz daha sade ilerliyor ve mock response’lar, cached response’lar ile küçük model deployment’ları baya iş görüyor.
Peki neden?
Ha bu arada, Bulut Maliyet Optimizasyonu: Hâlâ Geçerli Prensipler yazımda anlattığım genel bulut iyileştirme prensipleri AI ortamları için de geçerli. Tag’leme, resource group izolasyonu, budget policy’ler — bunlar AI workload’ları için de olmazsa olmaz gibi dürüyor. Asıl mesele disiplin; şey yanı, etiket koyup geçmek yetmiyor, düzeni de korumanız gerekiyor.
3. Production ve Ölçekleme
Production’a geçtikten sonra asıl iş başlıyor. Monitöring şart. Azure Cost Management + Billing üzerinden AI servislerini ayrı bir scope’ta izleyin; token consumption dashboard’u oluşturun çünkü hangi departman ne kadar tüketiyor, hangi endpoint en çok çağrılıyor bunları bilmeden optimize etme yapamazsınız.
Kısa bir not düşeyim buraya.
Bir de şunu söyleyeyim — production’da model versiyonu takibi kritik. OpenAI sürekli yeni versiyon çıkarıyor. Bazen yeni versiyon hem daha hızlı hem daha ucuz oluyor; bazen de beklentiniz kadar parlak çıkmıyor, evet öyle durum da var ama sız eski versiyonda takılı kalıyorsanız hem performans hem maliyet kaybediyorsunuz.
Microsoft’un Sunduğu Araçlar: İşe Yarıyor mu?
Açık konuşayım, Microsoft bu tarafa bayağı yatırım yapıyor. Peki, azure Cost Management var, Azure Advisor var, bir de yeni gelen AI odaklı öneriler çıkmış; fena değil aslında. Ama yetiyor mu? Hmm.
Azure Advisor’ın AI workload önerileri henüz biraz ham dürüyor. “Kullanılmayan deployment’ları silin” diyor, tamam güzel, ama bunu zaten çoğu ekip biliyor. Bana asıl şunu söylesin: “Bu model yerine şu modeli kullanırsan %35 tasarruf edersin, doğruluk kaybın da %1.2 olur.” Henüz o noktada değil, açıkçası. Yine de yön doğruya dönmüş, sadece tempo biraz ağır gidiyor.
Microsoft Cost Optimization workbook’u ve Well-Architected Framework’ün AI lens’i işe daha işe yarar geliyor. Mesela kurumsal müşterilerde WAF AI assessment’ı iyi bir başlangıç noktası oluyor; hani ilk bakışta çok süslü görünmüyor. Işi toparlıyor. Biz Logosoft’ta birkaç müşteride bu assessment’ı uyguladık. Her birinde en az %15-20 maliyet azaltma fırsatı gördük, bazen beklediğimizden daha net çıktı sonuçlar.
Pratik Adımlar: Yarın Sabah Ne Yapmalısınız?
Lafı çok uzattım, şimdi somut işlere geçelim. Eğer AI harcamalarını biraz olsun dizginlemek istiyorsanız, yarın sabah ilk iş olarak şunlara bakın; çünkü işin aslı, bütçe kaçıran şey çoğu zaman model değil, kontrolsüz kullanım oluyor.
- AI harcamalarını ayrıştırın: Genel bulut bütçesinin içine gömmeyin. Ayrı resource group açın, ayrı tag kullanın, raporu da ayrı tutun; yoksa ay sonunda nereden patladığını anlamak zorlaşıyor. (bu kritik)
- Model-maliyet matrisi oluşturun: Her use case için hangi modeli kullandığınızı yazın, token maliyetini yanına koyun, bir de alternatif model ne olurdu diye ekleyin. Basit bir tablo gibi dürüyor ama insan bazen tam burada şaşırıyor.
- Rate limiting ve quota yönetimi kurun: Her departman ya da proje için token kotası belirleyin. Sınırsız kullanım var sanıyorsanız, fatura tarafı da sınırsız geliyor; hoş değil. (bence en önemlisi)
- Haftalık maliyet review toplantısı başlatın: Evet, haftalık. Aylık bakınca bazı dalgalanmalar gözden kaçıyor, çünkü AI maliyetleri bazen sessizce yükseliyor ve sonra bir bakmışsınız rakamlar hop diye yukarı çıkmış.
- Prompt engineering eğitimi verin: Kullanıcılara verimli prompt yazmayı öğretin. Kısa, net ve structured prompt’lar hem daha iyi sonuç veriyor hem de daha az token yakıyor; yanı iki tarafta da nefes aldırıyor.
Bu 5 adımı uygulayan müşterilerde ortalama %25-30 maliyet düşüşü gördüm. Abartmıyorum. Hatta bazen sorun teknoloji bile olmuyor; mesele doğrudan governance eksikliği çıkıyor, yanı kim neyi ne kadar kullandı sorusunun cevabı havada kalınca faturayı toparlamak da zorlaşıyor.
Evet.
Son Söz: AI Yatırımı Bir Maraton
Hani, AI maliyet iyileştirmeu tek seferlik bir iş değil. Sürekli dönen bir çark gibi, durmuyor; model fiyatları oynuyor, yeni modeller geliyor, kullanım şekilleri değişiyor, iş tarafı da başka yere kayıyor (doğal olarak), yanı bugün kurduğunuz yapı üç ay sonra yeniden bakılmak istiyor (buna dikkat edin). Kısacası, iş bitmiyor.
Bence burada en sık yapılan hata şu: AI maliyetini sadece IT’nın sırtına bırakmak. Pek öyle yürümüyor. Bu bir iş kararı, hem de öyle kenardan bakılıp geçilecek türden değil; CFO, CTO ve iş birimi yöneticileri aynı masaya oturmalı, çünkü FinOps yaklaşımını AI’a taşımadan bu iş biraz havada kalıyor, hatta AI için ayrı bir FinOps çerçevesi düşünmek daha mantıklı dürüyor.
AZ-305 sınavına hazırlanırken maliyet iyileştirmeu sorularına bakıp “hmm, fena değil ama biraz yüzeyde kalmış” dediğimi hatırlıyorum. Sonra AI workload’ları devreye girince tablo değişti; mevzu bir anda genişledi, çünkü artık sadece altyapı değil, model seçimi, çağrı sayısı, token tüketimi ve kullanım davranışı da masaya geliyor. Sertifika dünyası bunu henüz tam yakalamış olmayabilir ama sektör boş durmuyor (buna dikkat edin)
Neyse, çok dağıtmayayım. Eğer bu konuda yardıma ihtiyacınız varsa ya da kendi deneyiminizi paylaşmak isterseniz, blog üzerinden bana ulaşabilirsiniz. Bu alanı herkes adım adım öğreniyor; ben de dahil. Evet.
Sıkça Sorulan Sorular
AI maliyet optimize etmeu ile klasik bulut maliyet iyileştirmeu arasındaki fark ne?
Klasik bulut iyileştirmeunda compute, storage, network gibi sabit kaynakları yönetiyorsunuz. AI tarafında işe iş çok daha karmaşık — hani token tüketimi, model seçimi, inference sıklığı, training döngüleri derken maliyet faktörleri sürekli değişiyor. Aslında bu yüzden AI optimizasyonu bambaşka araçlar, metrikler ve governance yaklaşımı gerektiriyor.
Azure OpenAI’da maliyeti en hızlı nasıl düşürebilirim?
Bence en hızlı etkiyi model seçiminden alıyorsunuz. Her şey için en güçlü modeli kullanmak yerine, yeterli performansı veren en küçük modeli tercih edin. Mesela GPT-4o yerine GPT-4o mini’ye geçmek çoğu senaryoda %60-80 arası maliyet düşüşü sağlıyor — açıkçası bu rakam şaşırtıcı. Neden önemli bu? Sonraki adım olarak da prompt caching’i aktifleştirin.
AI ROI’sını nasıl ölçeyim?
Tek bir metrikle ölçmeye çalışmayın. Tecrübeme göre en sağlıklı yöntem şu: doğrudan maliyet tasarrufu, gelir etkisi, risk azaltma. Hız kazanımı olmak üzere 4 boyutta değerlendirmek. Her AI use case’i için bu 4 boyutta somut KPI’lar tanımlayın, yanı soyut hedefler koymayın. En az çeyreklik bazda da takip edin.
Küçük bütçeli bir ekibiz, AI maliyetlerini nasıl kontrol altında tutarız?
Pay-as-you-go modelde kalın. Rate limiting ve token kotası uygulayın. Mümkünse development ortamında yerel model çalıştırın — hani Foundry Local gibi seçenekler burada işe yarıyor. Bir de budget alert’leri agresif ayarlayın; bütçenin %50’sine ulaşınca bile uyarı gelsin, böylece müdahale için zamanınız olur.
Ve işler burada ilginçleşiyor.
PTU (Provisioned Throughput Units) ne zaman mantıklı oluyor?
Eh, Stabil ve yüksek hacimli production workload’larınız varsa PTU düşünmeye değer. Yanı genel kural şu: aylık token tüketiminiz belirli bir eşiğin üzerindeyse. Kullanım düzeniniz öngörülebiliyorsa PTU modeli pay-as-you-go’dan daha ekonomik çıkıyor. Ama düşük ya da dalgalı hacimde PTU almak açıkçası para kaybettiriyor — bence bu konuda aceleci davranmamak lazım.
Kaynaklar ve İleri Okuma
Cloud Cost Optimization: How to maximize ROI from AI — Microsoft Azure Blog
Azure Cost Management and Billing — Microsoft Learn
Küçük bir detay: Azure Well-Architected Framework: Cost Optimization Pillar
Tolga F.
Tam da şu sıralar şirketteki AI altyapı maliyetleri bizi bunaltmaya başlamıştı, özellikle inference tarafı tahmin ettiğimizden çok daha hızlı büyüdü. Token bazlı faturalandırmayı düzgün modellemeden projeye girmek gerçekten büyük hata olabiliyor.
Cenk B.
Token başına maliyet hesabı yaparken başlangıçta hiç düşünmediğimiz kalemler çıkıyor ortaya, özellikle inference tarafı. Bizim projede GPU saatlerini düzgün izlemeden gidince fatura sonunda ciddi sürpriz olmuştu. Model seçimi kadar bu tarafın da planlanması gerekiyor demek ki.
Burak S.
Token başına maliyet hesabı yaparken çoğu ekip sadece API faturasına bakıyor, GPU boşta bekleme sürelerini görmezden geliyor. Inference tarafında ne kadar kazanım sağlanabileceğini merak ediyorum açıkçası. Bu arada Node.js tarafında performans optimizasyonu yapanlar için şu yazı da ilgimi çekti: https://www.askinkilic.com.tr/nodejs-addonlarini-net-native-aot-ile-yazmak/
Cem A.
Inference maliyetlerini düşürmek için model quantization denemek istiyordum ama tam olarak nerede başlayacağımı bilmiyordum, bu yazı epey yol gösterici olmuş. Token bazlı faturalandırmada öngörülemeyen masraflar gerçekten baş ağrısı yapıyor.
Yorumlar kapalı.







4 comments