TECH·May 2, 2026New NVIDIA Research Shows Speculative Decoding in NeMo RL Achieves 1.8× Rollout Generation Speedup at 8B and Projects 2.5× End-to-End Speedup at 235BMarkTechPost
PAPER·April 30, 2026Accelerating RL Post-Training Rollouts via System-Integrated Speculative DecodingHugging Face Papers
PAPER·April 30, 2026International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2026Apple Machine Learning Research
PAPER·March 31, 2026TAPS: Task Aware Proposal Distributions for Speculative SamplingHugging Face Papers
PAPER·March 27, 2026S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-SpeculationHugging Face Papers
TECH·September 29, 2025Accelerating Qwen3-8B Agent on Intel® Core™ Ultra with Depth-Pruned Draft ModelsHugging Face Blog