배아 평가 AI, 성능만큼 중요한 것은 신뢰입니다

IVF에서 AI를 이야기할 때 가장 먼저 등장하는 것은 대개 성능 지표입니다.
AI가 임신 결과를 예측할 수 있는지,
배아를 더 표준화된 기준으로 평가할 수 있는지,
기존의 형태학적 평가보다 더 객관적인 참고 기준을 제공할 수 있는지와 같은 질문들입니다.
이 질문들은 물론 중요합니다.
하지만 실제 임상 현장에서 AI가 활용되기 위해서는 성능만으로는 충분하지 않을 수 있습니다.
최근 Journal of Assisted Reproduction and Genetics에 발표된 “Two sides of the same algorithm: a qualitative study of ART professionals’ and patients’ views on the use of machine learning for embryo assessment and selection”은 바로 이 지점을 다룬 연구입니다.
이 논문은 AI 모델의 정확도나 AUC를 평가한 연구가 아니라,
배아 평가와 선택 과정에서 machine learning을 활용하는 것에 대해 의료진과 환자가 어떻게 생각하는지를 인터뷰한 qualitative study입니다.
흥미로운 점은 의료진과 환자의 시각이 크게 다르지 않았다는 것입니다.
두 그룹 모두 배아 평가 과정에서 AI가 도움을 줄 수 있다는 가능성에는 열려 있었습니다.
다만 AI가 단독으로 판단을 내리는 방식보다는, 의료진의 검토와 설명이 함께 이루어지는 방식이 필요하다고 봤습니다.
특히 human oversight(사람의 관리 감독)는 반복적으로 언급된 핵심 요소였습니다.
배아 선택은 치료 과정에서 매우 중요하고 정서적으로도 민감한 의사결정입니다.
환자 입장에서는 의료진이 함께 판단하고 설명해주는 과정이 신뢰와 안심으로 이어질 수 있고,
의료진 입장에서도 최종 판단에 대한 책임과 임상적 맥락을 함께 고려하는 과정이 중요합니다.
투명성 역시 중요한 주제였습니다.
AI가 어떤 데이터를 바탕으로 결과를 산출했는지, 그 결과를 어느 정도까지 신뢰할 수 있는지,
실제 진료와 배양실 workflow 안에서 어떻게 활용될 것인지가 명확해야 한다는 의견이 나왔습니다.
또한, 알고리즘 오류, 데이터 편향, AI에 대한 과도한 의존, 배아연구원의 전문성이 약화될 수 있다는 우려도 함께 제기됐습니다.
이 연구의 결론은 AI가 배아 평가를 하는데 적합한지 아닌지를 묻기 보다는, 의료진과 환자 모두 AI의 가능성을 인정하고 있다는 점을 보여주고 있습니다.
다만 좋은 성능의 모델을 만드는 것과, 그 모델이 실제 현장에서 신뢰받으며 쓰이는 것은 다른 문제라는 점을 짚습니다.
IVF 전문가에게 이 논문은 중요한 메시지를 줍니다. 배아 평가 AI의 미래는 정확도만으로 결정되지 않습니다.
신뢰할 수 있는 방식으로 설명되고, 의료진의 판단과 함께 사용되며, 워크플로우 안에서 책임 있게 기록되고 활용될 때 AI는 더 의미 있는 도구가 될 수 있습니다.
결국 배아 평가에서 AI가 주는 가치는 의사 결정을 보조하거나 자동화하는 데만 있지 않습니다.
의료진이 참고할 수 있는 객관적이고 표준화된 기준점을 제공하고, 팀이 더 구조화된 방식으로 논의하고 기록할 수 있도록 돕는 데 있습니다.
AI가 IVF 현장에 자리 잡기 위해서는 성능만큼이나 신뢰, 투명성, 그리고 사람의 판단이 함께 설계되어야 하겠습니다.