본문으로 건너뛰기
트렌드 검색
검색
언어 바꾸기
English
“Reward hacking” 검색 결과
카테고리 설정
인기
최신
테크
코딩
사이언스
게이밍
영상
투자
논문
하드웨어
검색된 기사
제목
요약
태그
날짜
적용
테크
·
어제
AI 안전을 무시할 이유가 점점 사라지고 있다
The Verge
논문
·
그저께
소형 언어 모델 에이전트를 위한 강건한 강화학습을 향하여
Hugging Face Papers
테크
·
2026년 6월 1일
“AI 점수 믿지 마라”…오픈AI가 직접 밝힌 벤치마크의 치명적 한계
디지털투데이
테크
·
2026년 6월 1일
OpenAI가 "AI의 능력은 제대로 측정되지 않고 있을 가능성이 있다"고 주장
GIGAZINE
논문
·
2026년 5월 27일
방향 정렬이 언어 모델 강화학습에서 보상 해킹을 완화한다
Hugging Face Papers
테크
·
2026년 5월 25일
최첨단 AI 모델들, 고도화될수록 우려스러운 행동 보여
Futurism
논문
·
2026년 5월 21일
SpecBench: 장기형 코딩 에이전트의 보상 해킹 측정
Hugging Face Papers
테크
·
2026년 5월 20일
Cursor, Composer 2.5와 Kimi K2.5로 더 저렴한 코딩에 베팅
The New Stack
논문
·
2026년 5월 12일
Auto-Rubric을 보상으로: 암묵적 선호에서 명시적 멀티모달 생성 기준으로
Hugging Face Papers
논문
·
2026년 5월 12일
루브릭 기반 강화학습에서의 보상 해킹
Hugging Face Papers
논문
·
2026년 5월 11일
Flow-OPD: 플로우 매칭 모델을 위한 온-폴리시 증류
Hugging Face Papers
논문
·
2026년 4월 28일
1비트 위험 신호로 에이전틱 안전 사양 발견하기
Hugging Face Papers
1페이지
다음
트렌드
대시보드
리포트