Back to News Feed
Nvidia Developer Blog
September 24, 2026
positive
Efficient MoE Training for Biological Foundation Models
AI / LLM
<img width="768" height="432" src="https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-768x432.jpg" class="webfeedsFeaturedVisual wp-post-image" alt="DNA." style="display: block; margin-bottom: 5px; clear:both;max-width: 100%;" link_thumbnail="" decoding="async" srcset="https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-768x432.jpg 768w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-179x101.jpg 179w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-300x169.jpg 300w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-625x352.jpg 625w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-1536x864.jpg 1536w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-645x363.jpg 645w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-660x370.jpg 660w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-500x281.jpg 500w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-160x90.jpg 160w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-362x204.jpg 362w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-196x110.jpg 196w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-1024x576.jpg 1024w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-960x540.jpg 960w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix.webp 1920w" sizes="(max-width: 768px) 100vw, 768px" title="DNA-Helix" />As language models grow, scaling dense architectures becomes increasingly expensive. In a dense transformer, every token passes through every layer, so adding...<img width="768" height="432" src="https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-768x432.jpg" class="webfeedsFeaturedVisual wp-post-image" alt="DNA." style="display: block; margin-bottom: 5px; clear:both;max-width: 100%;" link_thumbnail="" decoding="async" loading="lazy" srcset="https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-768x432.jpg 768w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-179x101.jpg 179w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-300x169.jpg 300w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-625x352.jpg 625w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-1536x864.jpg 1536w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-645x363.jpg 645w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-660x370.jpg 660w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-500x281.jpg 500w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-160x90.jpg 160w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-362x204.jpg 362w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-196x110.jpg 196w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-1024x576.jpg 1024w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix-960x540.jpg 960w, https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/DNA-Helix.webp 1920w" sizes="auto, (max-width: 768px) 100vw, 768px" title="DNA-Helix" /><p>As language models grow, scaling dense architectures becomes increasingly expensive. In a dense transformer, every token passes through every layer, so adding capabilities increases computation for both training and inference. Mixture-of-experts (MoE) architectures take a different approach to scaling by using many subnetworks, or experts, while activating only a small subset for each token.</p>
<p><a href="https://developer.nvidia.com/blog/efficient-moe-training-for-biological-foundation-models/" rel="nofollow" data-wpel-link="internal" target="_self">Source</a></p>
Read original article ↗