Mixture Of Experts
Mixture Of Experts
NVIDIA Enhances MoE Training for Biological Models with Efficiency Gains
NVIDIA's BioNeMo MoE recipe optimizes training for biological foundation models, achieving 2.21x throughput gains using advanced Transformer Engine techniques.
Mixture Of Experts
Qwen3.8-Flash-Next Debuts on NVIDIA GB300 NVL72 for Long-Context AI
Alibaba's Qwen3.8-Flash-Next leverages NVIDIA's GB300 NVL72, previewing Qwen4 architecture with 1M-token context optimization.
Mixture Of Experts
Alibaba Unveils Qwen3.8-Flash-Next AI Model with 176B Parameters
Alibaba releases Qwen3.8-Flash-Next, a 176B-parameter Mixture-of-Experts model, previewing Qwen4 architecture and optimized for long-context tasks.
Mixture Of Experts
NVIDIA's GB200 NVL72 Revolutionizes AI with Enhanced MoE Performance
NVIDIA's GB200 NVL72 offers a 10x performance boost for AI models using Mixture-of-Experts architecture, setting new standards in efficiency and scalability.