PAPER·3 days agoOVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth ObservationHugging Face Papers
PAPER·3 days agoWould You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense ReasoningarXiv
PAPER·3 days agoWhen Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability EvidencearXiv
PAPER·3 days agoLEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language ModelsarXiv
PAPER·4 days agoDecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text SpaceHugging Face Papers
PAPER·6 days agoLeveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language ModelsHugging Face Papers