Shieldstral
TL;DR AI
2 min readKey summary
Researchers introduced Shieldstral, a 3B-parameter policy-adaptive multimodal safety classifier for content moderation.
It reframes moderation as binary question answering and unifies multiple safety datasets into one training setup.
Trained on about 54.1 million curated and generated samples, it reportedly matches or beats models nearly seven times larger on text safety benchmarks.
Shieldstral also achieves new state-of-the-art results on multimodal safety classification, hinting that smaller safety models can rival much larger systems.
