Büyük dil modellerinin hızla büyümesi veri merkezlerindeki işlem gücü ihtiyacını doğrudan artırırken, Çin merkezli teknoloji devi HUAWEI CONNECT etkinliğinde yeni nesil altyapı çözümlerini sahneye çıkardı. Şirketin duyurduğu Huawei Atlas 960E, 10 trilyon parametre seviyesine yaklaşan modellerin eğitim ve çıkarım süreçlerini hızlandırmak üzere geliştirilen NPO tabanlı bir SuperPoD sistemi olarak dikkat çekiyor.
Etkinlikte paylaşılan resmi verilere göre sistem, 4.096 adet yapay zekâ işlemcisini tek bir küme halinde çalıştırarak 16 EFLOPS seviyesine kadar bilgi işlem kapasitesi sağlıyor. Altyapının temelinde yer alan donanım bileşenleri, yüksek hesaplama kapasitesini daha düşük güç tüketimiyle bir araya getirmeyi hedefliyor.
Huawei Atlas 960E Mimarisinde Optik Bağlantı ve Hi-ONE Donanımı
Binlerce işlemcinin eşzamanlı çalışabilmesi için gereken geleneksel ağ mimarileri, on binlerce optik alıcı-verici modülüne ihtiyaç duyuyor. Şirket, bu donanım yükünü hafifletmek adına kendi ışık kaynağını bünyesinde barındıran Hi-ONE optik motorunu sisteme dahil etti. Seri üretime geçtiği belirtilen Hi-ONE birimleri, saniyede 7,2 Tbit veri aktarım hızını destekliyor.
Huawei Atlas 960E kümesinde görev yapan 5.500 adet Hi-ONE birimi, klasik veri merkezi kurgularında ihtiyaç duyulan 48 bin adet 800G optik modülün görevini tek başına üstleniyor. Donanım parça sayısındaki bu ciddi düşüş, arıza riskini azaltırken enerji tüketiminde 550 kilovatın üzerinde tasarruf sağlıyor. Şirket mühendisleri, bu mimari tercihin sistemin hatasız çalışma süresini iki katına çıkardığını ve toplam sistem kullanılabilirlik oranını yüzde 99,8 seviyesine taşıdığını vurguluyor.
Yapay zekâ alanındaki genel donanım standartları ve küresel bilgi işlem mimarileri hakkında daha kapsamlı teknik dökümantasyon için IEEE resmi platformu üzerindeki sektörel standartlar incelenebilir.
TaiShan 950 ve OceanStor M900 ile Genişleyen Bellek Yapısı
Etkinlikte yalnızca hızlandırıcı işlemciler değil, genel bilgi işlem ve veri depolama birimleri de güncellendi. Tanıtılan TaiShan 950 SuperPoD, tamamen optik veri yolları üzerinden 4.096 bağımsız sunucu düğümünü bir araya getiriyor. Bu donanım kümesi, yapay zekâ ajanlarının büyük veri blokları arasında gecikmesiz hareket edebilmesi için 256 TB boyutunda birleşik bir bellek havuzu oluşturuyor.
Yapay zekâ modellerinin hafıza ve bağlam verilerini yönetmek amacıyla geliştirilen OceanStor M900 depolama sistemi ise petabayt seviyesindeki veriyi doğrudan işlem birimlerine tek adımda ulaştırıyor. Yapılan resmi sunumlara göre, birden fazla Huawei Atlas 960E bir araya getirilerek SuperCluster adı verilen devasa yapay zekâ ağları kurulabiliyor. Bu yapılar doğrudan 512 bin işlemciye, özelleştirilmiş topolojilerde ise 1 milyon işlemci sınırına kadar genişleyebiliyor.
CANN Yazılım Altyapısı Açık Kaynak Haline Getirildi
Donanım tarafındaki genişlemenin yanı sıra yazılım ekosisteminde de stratejik bir adım atıldı. Ascend donanım mimarisinin çekirdeğinde yer alan CANN (Compute Architecture for Neural Networks) yazılım katmanı açık kaynak olarak geliştiricilerin erişimine açıldı. Topluluk odaklı bir modele geçen bu yazılım mimarisi, farklı çerçevelerde hazırlanan yapay zekâ kodlarının doğrudan donanım üzerinde çalışmasını kolaylaştırıyor.
Etkinlikte konuşan şirket yöneticisi David Wang, açık kaynak yapısının model eğitim süreçlerinde dışa bağımlılığı azaltacağını ve bağımsız geliştiricilerin temel yapay zekâ modellerini Ascend donanımları üzerinde doğrudan optimize etmesine olanak tanıyacağını açıkladı.