AT&T ve Microsoft Foundry ile Trilyon Token Ölçeğinde AI
Telekomünikasyon sektöründe yapay zeka kullanımı hızla artıyor; ancak genel amaçlı modeller, telekom ağları, standartları ve operasyonlarına dair uzmanlık gerektiren senaryolarda yetersiz kalabiliyor. AT&T, bu boşluğu kapatmak için telekoma özel Open Telco (OTel) model ailesini geliştirdi. Yeni sürüm OTel2.0’ın inşası ise büyük bir dil modelini eğitmenin ötesine geçerek, alan odaklı yapay zeka sistemlerinin maliyet, performans ve operasyonel karmaşıklık arasındaki dengesini kurma sorununu gündeme getirdi. AT&T bu ölçekte ilerleyebilmek için Microsoft Foundry Managed Compute üzerinde dedike GPU kapasitesine yaslanan bir mimari tercih etti.
Telekom odaklı AI için ölçek sorunu
Daha önce ekiplerin kendi dağıtımlarını, altyapılarını ve bunlara bağlı operasyonel yükü yönetmesi gerekiyordu. Foundry Managed Compute, dedike GPU kapasitesine daha akıcı bir erişim sunarak bu yükü hafifletti. AT&T, Microsoft Foundry üzerinden birden fazla açık model üzerinde deney yapabildi, iş yüklerini farklı GPU mimarilerine göre optimize etti ve büyük hacimli telekom verilerini tek bir platformda işledi. Sonuçta trilyonlarca token’ı destekleyebilen, iterasyon ve optimizasyon hızını artıran bir geliştirme ortamı ortaya çıktı.
Çoklu açık model stratejisi
AT&T, tek bir modelde standartlaşmak yerine çoklu açık model yaklaşımını benimsedi. Açık modeller; onaylı telekom verisiyle çalışma, alan odaklı iş akışlarını uyarlama ve maliyet ile dağıtım stratejisi üzerinde daha fazla kontrol sağlama imkânı verdi. Ekip, Hugging Face koleksiyonundan Phi-4, OSS-120B ve Gemma-4 gibi modelleri; sentetik veri üretiminden veri hazırlığına, akıl yürütme yoğun iş yüklerinden geniş model geliştirme çalışmalarına kadar farklı aşamalarda kullandı.
Phi-4 bu süreçte özellikle öne çıktı: OTel2.0 için veri hazırlığı ve eğitim iş akışının bir parçası olarak aylık 700 milyardan fazla token işledi. Kaynakta öne çıkan model-iş yükü eşleşmeleri şu şekilde:
| Model | Örnek iş yükü |
|---|---|
| Phi-4 | Veri hazırlığı ve sentetik veri üretimi için aylık yaklaşık 700 milyar token |
| OSS 120B | Yüksek akıl yürütme gerektiren iş yükleri |
| Gemma 4 | OTel2.0 geliştirme iş akışları |
Heterojen GPU altyapısı
OTel2.0’ı geliştirmek, telekom ölçeğinde çalışabilen bir altyapı da gerektiriyordu. AT&T, Microsoft Foundry Managed Compute üzerinden yaklaşık 530 GPU kullandı; bunların 430’u AMD Instinct™ MI300X GPU. Birden fazla GPU mimarisini kapsayan bu heterojen yaklaşım, gereksinimler değiştikçe modellerin nasıl dağıtılıp optimize edileceği konusunda esneklik sağladı.
Bu tablo, farklı iş yükleri için doğru modeli seçebilme, maliyet ve performans için optimize edebilme ve operasyonel ortamı yeniden inşa etmeden ölçekleyebilme ihtiyacına verilen pratik bir yanıt olarak öne çıkıyor.
Dağıtım hızı ve maliyet ekonomisi
Hugging Face Ürün Başkan Yardımcısı Jeff Boudier’in aktardığına göre Microsoft Foundry, Hugging Face koleksiyonundaki güncel açık modelleri AMD ve NVIDIA GPU’larıyla tek bir yerde bir araya getirerek ekiplerin doğru modeli ve donanımı seçip haftalar yerine saatler içinde dağıtım yapmasına imkân tanıyor. AT&T örneğinde Foundry Managed Compute, modelleri günler içinde dağıtıp ölçekleme imkânı sunarak OTel2.0 geliştirme takvimini hızlandırdı.
AT&T’nin öncelikli hedeflerinden biri, AI kaynaklı iş değerini korurken model tüketim maliyetlerini düşürmekti. OTel2.0 kapsamında yaklaşık 1 trilyon token işlendi; bu veri, GSMA kaynaklı ham dokümanlar ile üretilen sentetik verinin birleşiminden oluşuyor. Kaynağa göre Phi-4 gibi açık kaynak modellerin Foundry Managed Compute üzerinde çalıştırılması, sentetik veri üretimini sınır (frontier) modellerle yapmaya kıyasla onlarca milyon dolarlık tasarruf sağladı ve ekiplerin daha büyük ölçekli deneylere yatırım yapmasını mümkün kıldı.
Kaynakta paylaşılan bazı öne çıkan rakamlar:
| Metrik | Değer |
|---|---|
| OTel 1.0 indirmeleri | 25 milyondan fazla |
| Foundry Managed Compute üzerinden kullanılan GPU | Yaklaşık 530 |
| OTel2.0 için işlenen token | Yaklaşık 1 trilyon |
| OTel2.0 için eğitilen token | Yaklaşık 400 milyar |
| Kullanılan modeller | Phi-4, OSS 120B, Gemma 4 |
AT&T Veri Bilimi ve Yapay Zeka Başkan Yardımcısı Mark Austin, yüz milyarlarca token işlerken altyapının çözülmesi gereken sorunun bir parçası haline geldiğini; Foundry Managed Compute’un sağladığı ölçekli GPU erişimi sayesinde ekiplerin altyapı yönetimi yerine OTel2.0’ı ilerletmeye odaklanabildiğini vurguluyor.
Üretim ölçeğinde AI için çıkarımlar
OTel2.0, açık modelleri ölçeklenebilir altyapı ve alan uzmanlığıyla birleştirerek üretime hazır yapay zeka sistemlerinin nasıl kurulabileceğine dair somut bir örnek sunuyor. Farklı iş yüklerini farklı modellerle eşleştirmek ve altyapıyı maliyet-performans dengesine göre optimize etmek, trilyonlarca token’ın operasyonel verimlilikten ödün vermeden işlenmesine olanak tanıdı. Deneme aşamasından üretime geçen kuruluşlar için model seçimi esnekliği, altyapı optimizasyonu ve verimli ölçeklenme giderek daha kritik hale geliyor; Microsoft Foundry ve Foundry Managed Compute bu yetkinlikleri tek bir platformda buluşturan yaklaşımlar arasında yer alıyor.
Kaynaklar ve İleri Okuma
- Orijinal yazı: AT&T and Microsoft scale trillion-token workloads with Microsoft Foundry and AMD
- Foundry Managed Compute genel bakış (Microsoft Learn)
- Announcing Foundry Managed Compute (Microsoft Dev Blogs)
- Microsoft Foundry ürün sayfası
- Phi model ailesi
- GSMA: Open Telco AI duyurusu
- Microsoft ve AMD ile Azure AI ve HPC altyapısı
- AMD Advancing AI: Sovereign AI at Scale
- AMD Advancing AI: What’s Next for AI Infrastructure in the Cloud
- İlgili yazı: Foundry Managed Compute: Açık Modelleri Üretimde Taşımak Kolaylaştı
- İlgili yazı: Microsoft Foundry & Fireworks AI: Açık Yapay Zeka







Yorum gönder