본문으로 건너뛰기
트렌드 검색
검색
언어 바꾸기
English
“Reward hacking” 검색 결과
카테고리 설정
인기
최신
테크
코딩
사이언스
게이밍
영상
투자
논문
하드웨어
검색된 기사
제목
요약
태그
날짜
적용
논문
·
5일 전
소형 언어 모델 에이전트를 위한 강건한 강화학습을 향하여
Hugging Face Papers
논문
·
2026년 5월 27일
방향 정렬이 언어 모델 강화학습에서 보상 해킹을 완화한다
Hugging Face Papers
논문
·
2026년 5월 21일
SpecBench: 장기형 코딩 에이전트의 보상 해킹 측정
Hugging Face Papers
논문
·
2026년 5월 12일
Auto-Rubric을 보상으로: 암묵적 선호에서 명시적 멀티모달 생성 기준으로
Hugging Face Papers
논문
·
2026년 5월 12일
루브릭 기반 강화학습에서의 보상 해킹
Hugging Face Papers
논문
·
2026년 5월 11일
Flow-OPD: 플로우 매칭 모델을 위한 온-폴리시 증류
Hugging Face Papers
논문
·
2026년 4월 28일
1비트 위험 신호로 에이전틱 안전 사양 발견하기
Hugging Face Papers
1페이지
다음
트렌드
대시보드
리포트