본문으로 건너뛰기
트렌드 검색
검색
언어 바꾸기
English
“보상모델” 검색 결과
카테고리 설정
인기
최신
테크
코딩
사이언스
게이밍
영상
투자
논문
하드웨어
검색된 기사
제목
요약
태그
날짜
적용
논문
·
그저께
판사를 코드로 정형화하기: 프로그램 증류를 통한 확장 가능한 평가
Hugging Face Papers
논문
·
2026년 6월 1일
RLHF의 이면: 보상 모델의 자기지도식 개선을 위한 온-폴리시 피드백
Hugging Face Papers
논문
·
2026년 5월 29일
RUBRIC-ARROW: 검증 불가능한 도메인에서 LLM 후학습을 위한 교차 포인트별 루브릭 보상 모델링
Hugging Face Papers
논문
·
2026년 5월 27일
CroCo: 자기 생성 기반의 교차 언어 대조 선호 튜닝
Hugging Face Papers
논문
·
2026년 5월 22일
비지도 프로세스 보상 모델
Hugging Face Papers
논문
·
2026년 5월 21일
확산 정렬을 위한 스티치드 가치 모델
Hugging Face Papers
논문
·
2026년 5월 20일
학습된 신뢰성을 활용한 프로세스 보상
Hugging Face Papers
논문
·
2026년 5월 19일
SafeDiffusion-R1: 안전한 디퓨전 후학습을 위한 온라인 보상 스티어링
Hugging Face Papers
논문
·
2026년 5월 19일
SafeDiffusion-R1: 안전한 디퓨전 후학습을 위한 온라인 보상 제어
arXiv
논문
·
2026년 5월 15일
RewardHarness: 자가 진화형 에이전틱 포스트 트레이닝
Hugging Face Papers
논문
·
2026년 5월 14일
Edit-Compass & EditReward-Compass: 이미지 편집 및 보상 모델링을 위한 통합 벤치마크
Hugging Face Papers
논문
·
2026년 5월 12일
DeltaRubric: 공동 계획과 검증을 통한 생성형 멀티모달 보상 모델링
Hugging Face Papers
1페이지
다음
트렌드
대시보드
리포트