미국 식품의약국(FDA)은 의료기기에서 생성형 인공지능을 사용하는 데 대한 규제 프레임워크를 마련하는 데 가까워지고 있다. 현재까지 FDA의 규제를 받는 방식으로 이 기술을 사용하는 의료기기는 아직 없다. 의료기기 기업들은 특히 안전성과 유효성 입증, 그리고 제품 출시 후에도 모델 성능이 지속되도록 보장하는 문제와 관련해 기관이 어떤 방향을 선택할지 주시하고 있다.
FDA는 8월에 논의 문서를 발표하고, 인공지능을 사용하는 기기의 시장 진입 전후 안전성을 어떻게 보장할지에 관한 이해관계자들의 의견을 요청했다. 미국 보건복지부 대변인 Grace Davis Jamison은 목표가 생성형 인공지능 기반 기기만의 과제를 파악하고 향후 지침 마련을 지원하는 것이라고 말했다.
승인된 제품이 아니라 시험에 존재하는 기술
이 자료에 따르면 FDA는 지금까지 인공지능 구성 요소를 포함한 기기를 1,500개 이상 허가했지만, 생성형 인공지능을 사용하는 기기는 허가하지 않았다. 그러나 FDA는 개발 중인 제한된 수의 도구에 혁신기기 지정(Breakthrough Device Designation)을 부여했다. 여기에는 흉부 X선 이미지를 분석하고 방사선학 보고서 초안을 작성하는 Aidoc과 Radiology Partners의 자회사 소속 두 개의 별도 기능, 그리고 병리학 이미지와 임상 데이터를 분석하는 Modella AI의 도구가 포함된다.
FDA는 또 Technology-Enabled Meaningful Patient Outcomes, 즉 TEMPO라는 디지털 헬스 실증 프로그램에 생성형 인공지능에 기반한 기기를 포함했다. 이 프로그램을 통해 기업은 시판 전 허가 요건을 면제받은 채 실제 세계 데이터를 수집할 수 있다. 참여 기업 중 하나인 Limbic은 인공지능 기반 음성 에이전트가 사용자와 상호작용하는 전화 통화를 통해 인지행동치료를 제공한다.
반면 현재 일부 기능은 FDA의 심사를 받지 않는다. Dexcom은 2024년에 처방전 없이 이용할 수 있는 포도당 센서에 생성형 기능을 추가해 사용자 데이터를 분석하고 개인별 웰니스 권고를 제공했으며, 이 기능에는 시판 전 규제 신청이 필요하지 않았다고 밝혔다.
제품 시험에서 역량 기반 평가로
논의 문서는 생성형 인공지능이 기존 기기 프레임워크에 쉽게 들어맞지 않는다는 점을 인정한다. 시스템은 변화하는 입력에 대응해 서로 다른 텍스트나 이미지를 생성할 수 있어 모든 가능성을 시험하고 안전성과 유효성을 측정하기 어렵다. 신뢰할 만해 보이는 잘못된 정보를 생성하는 환각은 추가적인 우려를 제기하며, 시간이 지나면서 모델 성능이 저하될 가능성도 문제다.
FDA는 시험과 감독, 공개 보고를 통해 의사를 평가하는 방식을 참고해 ‘역량 기반 평가’라는 개념을 제안한다. 가능한 모든 입력과 출력을 검사하려 하기보다, 시판 전 심사에서 벤치마킹과 요구되는 역량 수준을 측정하는 시험에 더 크게 의존할 수 있다는 것이다.
FDA는 기반 모델을 위한 선택적 마스터 파일을 만드는 방안도 제시한다. 이 구상에 따르면 모델 또는 기반 플랫폼 개발자는 FDA에 기밀 정보를 제출할 수 있다. 이를 통해 규제기관은 의료기기 내부에서 사용되는 기술을 파악하면서도, 각 기기 개발자에게 의존하는 모델의 모든 영업비밀을 공개하도록 요구하지 않을 수 있다.
시판 후 모니터링도 방정식의 일부가 된다
이 문서는 제품 출시 후 기기 모니터링의 중요성을 강조한다. FDA는 시판 전에 더 높은 수준의 불확실성을 허용하는 대신 데이터와 사후 모니터링에 더 크게 의존하는 것이 타당한지 검토하고 있다. Haynes Boone의 변호사 Kayla Cristales는 기관이 업데이트를 제출하고 기기의 발전을 추적하는 일에서 기업 자체에 크게 의존할 수 있다고 본다.
이 지점은 최초 허가 시험만으로 해결되지 않는 문제를 다룬다. 모델이 변하거나 사용 데이터가 바뀌거나, 시험 중에는 명확하지 않았던 실패 패턴이 나타날 수 있기 때문이다. 그러나 자료는 아직 모니터링 기준, 업데이트 주기, 개발자와 의료기관 각각의 세부적인 책임을 정하지 않았다.
왜 이 뉴스가 중요한가?
기업들은 서로 다른 정도로 지침을 기다리고 있다. Ketryx의 최고경영자 Erez Kaminski는 일부 개발자는 계속 추진하는 반면 다른 개발자는 기업 규모와 위험 감수 성향에 따라 기다리는 편을 택한다고 말했다. 자료가 인용한 전문가들은 현재 많은 도구가 행정적 사용, 업무 흐름 개선 또는 알려진 지침의 적용에 초점을 맞추고 있으며, 이러한 분야에서는 제품을 규제 대상 의료기기로 간주할 필요가 없을 수 있다고 본다.
Aidoc처럼 규제 영역에 진입하기로 이미 결정한 기업들은 전문 지침을 유용하게 여기지만, 그것이 진전을 위한 결정적 조건은 아니라고 본다. UpDoc의 최고경영자 Sharif Vakili는 규제상 리더십이 부재하면 시장이 서로 다른 규칙이 뒤섞인 상태로 나아가거나 유해한 사용에 뒤늦게 반응하게 될 수 있다고 말했다.
편집상의 관점에서 볼 때 실제 변화는 아직 구속력 있는 규칙의 발표에 있지 않다. 오히려 FDA가 인공지능에 관한 일반적인 논의에서 구체적인 규제 도구를 시험하는 단계로 옮겨가고 있다는 점에 있다. 여기에는 역량 기반 평가, 기반 모델 파일, 지속적인 모니터링이 포함된다. 이는 기업에 초기 신호를 제공하지만, 변화하는 모델을 어떻게 승인할지 또는 성능이 저하될 때 책임을 어떻게 정할지는 아직 결정하지 못한다.
제기된 질문은 의료기기 기업을 넘어선다. NYU Grossman School of Medicine의 의학윤리 조교수 Kellie Owens는 시판 후 더 강력한 감독을 요구했고, Generation Patient의 Luis Gil Abinader는 디지털 동반자와 챗봇이 건강 목적으로 판매되었는지 여부와 관계없이 더 많은 감독을 받아야 한다고 주장했다. 상업용 챗봇은 현재 FDA의 범위 밖에 있지만, 일부 챗봇이 심리치료를 제공한다고 거짓으로 주장하는 사례를 포함해 정신건강 지원에 사용되는 것에 대한 우려가 있다. 또한 FDA의 기기 센터는 디지털 정신건강 기기의 임상 근거 지침을 현재 회계연도에 준비 중인 업무 목록에 포함했다.