연방 정부는 검증되지 않은 기술을 서둘러 도입하는 경우가 드뭅니다. 특히 공중 보건 부서는 환자 기록이나 발병 데이터에 적용하기 전, 도구를 검증하는 데만 수년을 보낼 수 있습니다. 따라서 미국 보건 기관들이 OpenAI와 Anthropic이 구축한 생성형 AI 시스템으로 실전 테스트를 실시하겠다고 발표했을 때, 그 신호는 명확했습니다. 거대 언어 모델이 소비자용 실험 단계를 넘어 진지한 기관용 후보로 부상했다는 것입니다.

PULSE의 실제 역할

이 새로운 노력의 명칭은 Public Health Use Case and Learning Scaling Engine, 줄여서 PULSE입니다. 이는 제품 출시가 아닌 테스트 프레임워크입니다. 보건 부서의 이메일 시스템에 챗봇을 무작정 투입하고 결과가 좋기를 바라는 대신, PULSE는 생성형 AI를 공중 보건 분야에서 새로운 백신을 다루는 것과 동일한 방식으로 취급합니다. 주, 지방, 부족 및 영토 관할 기관이 부작용을 엄격히 모니터링하면서 이러한 도구들을 시험해 볼 수 있는 통제된 환경을 조성합니다.

이 프로그램에는 네 개의 서로 다른 파트너가 참여합니다. Coalition for Health AI (CHAI)는 의료 특화 거버넌스 및 안전 표준을 제공합니다. OpenAI와 Anthic은 최첨단 언어 모델을 제공합니다. Accenture는 수십 년 된 데이터베이스와 엄격한 조달 규칙에 따라 운영되는 기존 정부 인프라에 이러한 시스템을 연결하는 데 필요한 통합 전문 지식을 제공합니다.

PULSE는 AI가 이메일을 작성하거나 회의록을 요약할 수 있는지 묻는 것이 아닙니다. 이 모델들이 세 가지 핵심 과업인 역학적 감시(epidemiological surveillance), 자원 배분(resource allocation), 공중 보건 커뮤니케이션(public health communication)을 안정적으로 지원할 수 있는지를 묻고 있습니다. 각각은 추상적으로 들릴 수 있지만, 이들을 합치면 보건 부서를 운영하는 데 따르는 일상적인 부담을 설명하게 됩니다. '감시'는 실험실 보고서, 병원 입원 기록, 학교 결석 데이터를 분석하여 발병이 확산되기 전에 포착하는 것을 의미합니다. '자원 배분'은 심각한 독감 시즌 동안 한정된 백신 용량이나 항바이러스제를 어디로 보낼지 실시간으로 결정하는 것을 의미합니다. '공중 보건 커뮤니케이션'은 복잡한 연방 지침을 수십 개의 다양한 커뮤니티가 이해할 수 있는 쉬운 언어로 번역하는 것을 의미하며, 이는 종종 식중독 조사와 같이 시간이 촉박한 상황에서 이루어집니다. 만약 AI가 추가적인 업무를 만들거나 오류를 유발하지 않고 이 중 어느 하나라도 도울 수 있다면, 그 효율성 증대는 상당할 것입니다.

10개 관할 구역이 모든 것을 바꾸는 이유

이 프로그램은 주, 지방, 부족 국가 및 미국 영토에서 선정된 10개 관할 구역에서 테스트를 진행할 예정입니다. 이러한 의도적인 확산이 바로 핵심입니다. 수백 명의 역학자가 근무하고 광섬유 네트워크를 운영하는 인구 밀집 지역의 주 보건 부서는, 최소한의 인력과 간헐적인 연결 상태로 뎅기열을 추적하는 영토 관할 기관과는 완전히 다른 제약 조건에 직면해 있습니다.

부족(Tribal)의 포함은 특히 중요한 의미를 갖습니다. 부족 보건 기관은 역사적으로 만성적인 예산 부족과 심각한 데이터 주권 문제에 직면해 왔습니다. 부족 관할 구역을 포함함으로써, PULSE는 국가적 효용을 주장하는 모든 AI 도구가 특수 인구 집단을 다루어야 하며, 고유한 거버넌스 구조를 존중해야 하고, 독특한 환경적 및 사회적 보건 부담이 있는 환경에서도 작동해야 함을 인정하는 것입니다. 모델이 이러한 조건에서 성능을 발휘하지 못한다면, 연방 정부의 승인을 받을 자격이 없습니다.

영토 관할 기관은 또 다른 필수적인 스트레스 테스트를 제공합니다. 미국 영토의 공중 보건 관리자들은 본토와는 확연히 다른 질병 패턴과 공급망을 관리합니다. 완벽한 인터넷 연결을 가정하거나 대도시 병원에서 흔히 사용하는 ICD-10 코딩 습관에 의존하는 AI 어시스턴트는 허리케인이 인프라를 파괴했을 때 제대로 작동하지 못할 것입니다. 10개 관할 구역 설계는 이러한 모델이 불완전한 환경에 적응하는지, 아니면 무너지는지에 대한 확실한 증거를 수집하도록 강제합니다.

챗봇에서 미션 크리티컬 인프라로

지난 2년 동안 거대 언어 모델을 둘러싼 대중의 관심은 코딩 지름길, 마케팅 문구, 이미지 생성에 집중되어 있었습니다. PULSE는 의도적으로 그 초점을 미션 크리티컬 인프라(mission-critical infrastructure)로 전환합니다. 보건 부서가 감염병 보고서를 분석하기 위해 AI 모델을 사용할 때, 실수는 단순한 환각(hallucination) 현상이 아닙니다. 그것은 잠재적인 공공 안전의 실패입니다.

이러한 현실로 인해 이번 파일럿 프로그램은 정확성, 환각(hallucination) 완화, 데이터 프라이버시라는 세 가지 지속적인 기술적 문제에 대한 선례를 남기게 될 것입니다. 이 문맥에서 환각이란 모델이 약물 상호작용을 조작하거나, 존재하지 않는 발병 클러스터를 만들어내거나, 보고 규정을 잘못 설명하는 것을 의미할 수 있습니다. PULSE는 이러한 오류가 얼마나 자주 발생하는지, 그리고 기술적 가드레일이 의사 결정자에게 전달되기 전에 이를 포착할 수 있는지를 측정하도록 설계되었습니다.

프라이버시 또한 동일한 비중을 차지합니다. 공공 보건 기관은 HIPAA 및 추가적인 주 법률의 적용을 받는 보호 대상 건강 정보(PHI)를 취급합니다. 이 데이터를 다루는 모든 AI 시스템은 무엇을 저장하는지, 학습 데이터가 어디로 흐르는지, 그리고 나중에 누가 결과물에 접근할 수 있는지를 정확히 입증해야 합니다. CHAI의 참여는 이번 시험이 OpenAI와 Anthropic 모델의 순수한 지능뿐만 아니라, 엄격한 기관 거버넌스 프레임워크 내에서 작동하고 깨끗한 감사 추적(audit trails)을 남길 수 있는 능력을 테스트할 것임을 시사합니다.

개발자와 규제 기관을 위한 청사진

헬스케어 AI를 구축하는 개발자와 스타트업 창업자들에게 PULSE는 시장이 절실히 필요로 하는 것, 즉 가시적이고 정부가 뒷받침하는 표준을 제공합니다. 신생 기업들은 조달 담당자들에게 AI 안전성을 평가할 공통 체크리스트가 없기 때문에 공공 보건 시스템에 제품을 판매하는 데 어려움을 겪는 경우가 많습니다. 만약 PULSE가 행정 보건 환경에서 편향성, 정확성, 프라이버시를 측정하기 위한 투명한 기준을 만들어낸다면, 그 기준은 전국 공급업체들을 위한 기본 벤치마크로 빠르게 자리 잡을 수 있습니다.

이 프로그램은 또한 거대 언어 모델(LLM)이 정부를 지원하기 위해 어떻게 진화해야 하는지에 대한 실마리를 제공합니다. 소비자용 챗봇은 유창하고 도움이 되는 응답에 최적화되어 있습니다. 반면 정부의 보건 업무에는 인용, 보정된 불확실성(calibrated uncertainty), 그리고 제도적 기억(institutional memory)이 필요합니다. 간호 역학자에게 조언하는 모델은 확신에 찬 답변을 지어내기보다는 "증거가 불분명합니다"라고 말할 수 있어야 합니다. OpenAI와 Anthropic이 이러한 환경에 맞춰 프롬프팅 전략과 검색 시스템을 어떻게 조정하는지 지켜보는 것은, 기반 기술이 실제로 관료적 기대치를 충족할 수 있는지 여부를 보여줄 것입니다.

이번 파일럿이 성공한다면, 기술 및 거버넌스에 대한 통찰력은 미국 국경을 넘어 전 세계로 확산될 수 있습니다. 전 세계 공공 보건 부서들은 유사한 데이터 부담과 인력 부족 문제에 직면해 있습니다. 역학 및 보건 커뮤니케이션 분야에서 LLM을 배포하기 위한 검증된 프레임워크는, FHIR 표준이 전자 건강 기록(EHR)에 했던 것처럼 국제적인 참조 기준이 될 수 있습니다.

핵심 요점

PULSE는 인공지능이 공공 보건을 해결할 것이라는 약속이 아닙니다. 이는 건강 정보를 처리하는 기존 방식이 너무 느리고 노동 집약적이라는 인정이며, 어떤 대체 기술이든 전국적으로 확대되기 전에 현실적이고 다양한 조건 하에서 검증되어야 한다는 것을 의미합니다. CHAI의 안전 프레임워크를 OpenAI와 Anthropic의 프런티어 모델과 결합하고, 이 도구들이 실제로 서로 다른 10개의 관할 구역에서 스스로를 증명하도록 함으로써, 이 프로그램은 생성형 AI에 대해 마땅히 가져야 할 회의적인 시각을 유지하는 동시에 필요한 테스트 환경을 제공합니다. 보건 관계자, 개발자, 그리고 그들이 봉사하는 지역 사회에게 있어, 그러한 균형이야말로 책임감 있는 도입의 진정한 모습입니다.