네이처 포트폴리오의 npj 디지털 메디신에 게재된 중국 퓨처 닥터 팀의 새로운 벤치마크, 의료 AI의 '안전하고 효과적' 의미를 정의하는 것을 목표로

2026년 2월 5일 · Unknown · financial · 출처 Yahoo Finance

네이처 포트폴리오(Nature Portfolio)의 npj 디지털 메디슨(npj Digital Medicine)에 게재된 중국 퓨처 닥터(Future Doctor) 팀의 새로운 벤치마크는 의료 AI에 대한 '안전하고 효과적'의 의미를 정의하는 것을 목표로 합니다.

뉴욕, 2026년 2월 4일 --(비즈니스 와이어)-- 중국 기반 AI 헬스케어 기술 기업 퓨처 닥터(Future Doctor)는 32명의 임상 전문가와 함께 네이처 포트폴리오의 npj 디지털 메디슨에 새로운 연구를 발표하며 '임상 안전성-효과성 이중 트랙 벤치마크(Clinical Safety-Effectiveness Dual-Track Benchmark, CSEDB)'를 제안했습니다. 이 프레임워크는 의료 AI 시스템이 실제 임상 의사 결정에서 안전하고 효과적인지를 측정하기 위해 설계되었습니다. 오픈AI의 o3, 구글의 제미니 2.5 프로(Gemini 2.5 Pro), 앤트로픽의 클로드 3.7 소넷(Claude 3.7 Sonnet)을 포함한 주요 대형 언어 모델(LLM)에 대한 비교 평가에서, 해당 회사 자체의 메드GPT(MedGPT)가 모든 주요 범주에서 가장 높은 점수를 받은 것으로 나타났습니다.

이 연구는 새로운 의료 AI 모델 출시가 급증하는 가운데 나왔습니다. 이는 강력한 범용 성능과 임상 실무에 필요한 안전성 및 신뢰성 간의 격차에 대한 관심을 더욱 고조시키고 있으며, 여기서 환각(hallucination)과 확신에 찬 오류는 여전히 주요 병목 현상으로 남아 있습니다. 이러한 배경 속에서, 이 연구는 평가가 실제 임상 사용의 지속적인 병목 현상임을 강조합니다. 대부분의 의료 AI 평가는 여전히 표준화된 테스트와 유사한 반면, 긴급 증상을 놓치거나, 금기 사항을 권고하거나, 다중 상태 우선순위 결정에 실패하는 것과 같은 안전에 중대한 영향을 미치는 실패 모드는 종종 정확도만을 측정하는 점수 체계에서는 나타나지 않습니다.

CSEDB는 그러한 위험을 반복 가능한 점수 체계에서 측정 가능하도록 설계되었습니다. 논문에 따르면, CSEDB는 17개의 안전성 지표와 13개의 효과성 지표로 나뉜 총 30개의 지표를 포함합니다. 이 벤치마크는 중국의 선도적인 의료 기관들(베이징 협화의원, 중국의학과학원 종양병원, 중국 인민해방군 총병원, 상하이 통지병원, 푸단대학 화산병원, 베이징대학 구강병원 포함)의 23개 핵심 전문 분야에 걸친 32명의 임상 전문가들과 함께 개발되었습니다.