Anthropic의 새 벤치마크, Claude가 생물정보학에서 인간 전문가와 맞먹는다고 주장
Anthropic's new benchmark claims Claude can match human experts in bioinformatics

TL;DR AI
1분핵심 요약
앤트로픽은 실제로 노이즈가 많은 바이오인포매틱스 데이터와 객관적으로 검증 가능한 정답으로 구성된 99문항 벤치마크 BioMysteryBench를 공개했다.
Claude는 전문가가 풀 수 있는 과제에서는 인간 전문가 수준에 근접했지만, 가장 어려운 문제에서는 신뢰도와 일관성이 크게 떨어졌다.
이 벤치마크는 암기보다 실제 연구 역량을 평가하도록 설계됐으며, 현재 Hugging Face에서 공개되어 있다.
이번 결과는 최첨단 AI가 일부 바이오인포매틱스 연구에 도움이 될 수 있음을 보여주지만, 고득점이 어려운 문제에서의 안정성을 보장하지는 않는다.
