본문으로 건너뛰기
트렌드 검색
검색
언어 바꾸기
English
“AIEvaluation” 검색 결과
카테고리 설정
인기
최신
테크
코딩
사이언스
게이밍
영상
투자
논문
하드웨어
검색된 기사
제목
요약
태그
날짜
적용
테크
·
5일 전
앤트로픽이 정체성을 찾는 데 도움을 준 24시간 실험
The New Stack
테크
·
6일 전
프런티어 랩 에이전트 침해 해부: 2026년 7월 사건의 기술적 타임라인
Hugging Face Blog
테크
·
2026년 7월 26일
무상태 평가와 맥락 기반 평가의 차이로 AI 생성 정신건강 조언이 오판받아
Forbes
테크
·
2026년 6월 3일
트럼프의 AI 평가 명령: 올바른 정책, 그러나 미완의 거버넌스
Forbes
테크
·
2026년 6월 1일
OpenAI가 "AI의 능력은 제대로 측정되지 않고 있을 가능성이 있다"고 주장
GIGAZINE
테크
·
2026년 5월 27일
Cohere와 Mila, 퀘벡 프랑스어 AI 협력
Cohere Blog
논문
·
2026년 5월 26일
음성 언어 처리 작업을 위한 로봇-환자 및 의사-환자 의료 대화 데이터셋
arXiv
논문
·
2026년 5월 21일
벤치마크 구축을 통한 AI 교육: 책임 있는 지식 노동을 위한 강의 기반 실천으로서의 QuestBench
arXiv
코딩
·
2026년 5월 8일
Anthropic의 모델들은 자신이 감시받고 있을 때를 안다
Dev.to
테크
·
2026년 5월 1일
Anthropic, 생명 정보 분석 벤치마크 ‘BioMysteryBench’ 발표… Mythos, 인간이 풀지 못한 문제의 약 30% 해결
GIGAZINE
논문
·
2026년 4월 25일
ProEval: 생성형 AI 평가를 위한 선제적 실패 탐지와 효율적 성능 추정
Hugging Face Papers
테크
·
2025년 9월 26일
실제 업무에서 우리의 모델 성능 측정하기
OpenAI
1페이지
다음
트렌드
대시보드
리포트