LLM TRAINING

AMD’s TLX Kernel Boosts GEMM Performance for LLM Training
Llm Training

AMD’s TLX Kernel Boosts GEMM Performance for LLM Training

AMD's TLX optimizations accelerate GEMM, cutting memory bottlenecks and enhancing large language model training on GPUs.

NVIDIA Introduces Nonuniform Tensor Parallelism for Large-Scale LLMs
Llm Training

NVIDIA Introduces Nonuniform Tensor Parallelism for Large-Scale LLMs

NVIDIA's Nonuniform Tensor Parallelism enables resilient training of large-scale LLMs across thousands of GPUs, minimizing downtime and optimizing Goodput.

NVIDIA Megatron Core Gets Falcon-H1 Hybrid AI Architecture Support
Llm Training

NVIDIA Megatron Core Gets Falcon-H1 Hybrid AI Architecture Support

Technology Innovation Institute integrates Falcon-H1 hybrid architecture and BitNet ternary training into NVIDIA's Megatron Core, enabling efficient large language model development.