Switch language한국어
Back to the list

dMoE: dLLMs with Learnable Block Experts

TL;DR AI

Key summary

2 min read
  1. Researchers introduced dMoE, a block-level mixture-of-experts method for diffusion large language models.

  2. Instead of routing experts per token, it aggregates token-level preferences into one decision per block.

  3. This reduces the number of activated experts, cuts memory use, and improves end-to-end latency.

  4. The method preserves nearly all baseline performance while making inference more efficient.

Read the original