손글씨 숫자를 인식하도록 양자 신경망을 학습시킨다고 가정해 봅시다. 정확도가 안정될 때까지 회로 파라미터를 조정합니다. 그 후 두 번째 작업인 의류 이미지 분류를 제시합니다. 모델은 빠르게 적응합니다. 하지만 다시 숫자를 테스트했을 때, 성능은 급락해 있습니다. 회로가 학습한 내용을 바탕으로 발전한 것이 아니라, 그것을 대체해 버린 것입니다.

이것이 바로 '파괴적 망각(catastrophic forgetting)'이며, 머신러닝에서 가장 고질적인 문제 중 하나입니다. 고전적 모델도 이 문제로 끊임없이 고군분투합니다. 양자 모델은 이와 동일한 딜레마에 훨씬 더 날카로운 형태로 직면하는데, 이는 양자 모델의 내부 작동 방식이 직접 관찰하는 순간 파괴되는 중첩(superposition)과 얽힘(entanglement)에 의존하기 때문입니다. Quantum Elastic Weight Consolidation, 즉 QEWC라고 불리는 유망한 새로운 접근 방식은 양자 상태 자체를 고전적인 측정 결과의 집합이 아닌 하나의 기하학적 객체로 취급함으로써 이 문제를 해결합니다.

왜 양자 회로에서 망각이 더 치명적인가

학습 가능한 모든 시스템에서 학습은 오차를 줄이기 위해 파라미터를 조정함으로써 이루어집니다. 위험한 점은 어제의 최적 파라미터가 오늘의 변수가 될 수도 있다는 것입니다. 모델이 새로운 작업에 맞추기 위해 파라미터를 다시 쓰면, 이전의 지식을 인코딩했던 특정 구성들을 지워버리는 경우가 많습니다. 그 결과, 시스템은 지속적으로 학습하는 것처럼 보이지만 실제로는 고립된 숙련도의 스냅샷들을 반복해서 순환할 뿐입니다.

양자 머신러닝은 이 문제를 더욱 심화시킵니다. 메모리 보존을 위한 고전적인 접근 방식은 대개 모델이 측정에 어떻게 반응하는지를 관찰하는 것에 의존합니다. 본질적으로 "네트워크의 이 부분을 건드리고 출력을 관찰했을 때, 얼마나 변하는가?"라고 묻는 것입니다. 이러한 논리는 시스템을 근본적으로 방해하지 않고도 관찰할 수 있다는 가정을 전제로 합니다. 하지만 양자 역학은 그러한 보장을 해주지 않습니다. 측정은 중첩을 붕괴시킵니다. 어떤 파라미터가 가장 중요한지 확인하려는 행위 자체가 보호하려는 바로 그 상태를 변화시킬 수 있습니다.

고전적 메모리 가드레일이 놓치는 것

전통적인 AI는 측정 의존적인 통계에 데이터를 고정함으로써 중요한 데이터를 보호합니다. 이러한 고전적 방법들은 특정 판독(readout) 하에서 시스템이 어떻게 행동하는지를 통해 파라미터의 중요도를 추적합니다. 기반이 되는 하드웨어가 고전적인 규칙을 따를 때는 이 방식이 충분히 잘 작동합니다. 하지만 양자 프로세서는 그렇지 않습니다.

양자 회로는 직접적으로는 볼 수 없는 기하학적 구조를 가진 고차원 상태 벡터에 정보를 인코딩합니다. 해당 정보를 보호하기 위해 투영 측정(projective measurement)에 의존하는 것은 비눗방울을 쿡쿡 찔러가며 그 모양을 유지하려는 것과 같습니다. 데이터는 얻을 수 있겠지만, 비눗방울은 이미 변해버린 상태일 것입니다. 연구자들에게 필요한 것은 매번 출력을 직접 들여다보지 않고도 중요도를 감지할 수 있는 방법이었습니다.

양자 피셔 정보(Quantum Fisher Information) 접근법

여기에서 양자 피셔 정보(QFI)가 등장합니다. QFI는 양자 계측학(quantum metrology)에서 유래한 도구로, 양자 상태가 기저 파라미터의 미세한 변화에 얼마나 민감하게 반응하는지를 측정합니다. QFI는 측정이 무엇을 보여주는지를 묻는 대신, 상태 자체의 기하학적 구조가 각 파라미터를 중심으로 어떻게 휘어지는지를 묻습니다. 상태 공간의 가파른 영역, 즉 아주 작은 움직임만으로도 큰 기하학적 변화를 일으키는 곳에 위치한 파라미터들이 작업에 필수적인 지식을 가장 많이 담고 있는 것으로 나타납니다.

QFI를 사용함으로써 연구자들은 중요도를 양자 상태의 기하학적 구조에 직접 매핑할 수 있습니다. 이 방법은 무엇이 중요한지를 확정하기 위해 특정 측정 기저를 필요로 하지 않습니다. 상태를 하나의 표면으로 보고, 평평해져서는 안 될 '언덕'들을 식별해 내는 방식입니다.

QEWC가 지식을 보호하는 방법

Quantum Elastic Weight Consolidation은 이러한 기하학적 통찰을 학습 프로토콜로 전환합니다. 이 과정은 다음과 같은 구체적인 단계로 나눌 수 있습니다.

  • 중요 파라미터 식별. 첫 번째 작업을 학습한 후, QEWC는 회로 파라미터 전반에 걸쳐 양자 피셔 정보(QFI)를 계산합니다. 높은 점수는 핵심 지식을 저장하고 있는 특정 회전(rotation)과 얽힘(entanglement)을 표시합니다.

  • 중요 부분 고정. 후속 학습 동안 QEWC는 QFI가 높은 파라미터의 변화에 페널티를 부여합니다. 회로는 이미 알고 있는 내용을 덮어쓸 때 비용을 지불해야 합니다.

  • 나머지는 적응하도록 허용. QFI 점수가 낮은 파라미터는 제약을 덜 받습니다. 회로는 유연성을 유지하며, 새로운 입력 패턴에 맞추기 위해 중요도가 낮은 자유도를 재형성합니다.

  • 안정성과 가소성의 균형. 이 프레임워크는 기존 지식을 유지하는 것과 새로운 정보를 흡수하는 것 사이의 균형을 명시적으로 조절합니다. 회로 전체를 얼려버리지도 않으며, 모든 것이 제멋대로 변하게 두지도 않습니다.

이러한 균형이 중요한 이유는 회로가 완전히 고정되면 새로운 것을 전혀 배울 수 없고, 반대로 완전히 가소성이 높으면 기존의 모든 것을 잊어버리기 때문입니다. QEWC는 양자 상태 자체의 기하학적 구조를 존중함으로써 그 중간 지점을 찾아냅니다.

실제 하드웨어에서의 노이즈 저항성

현재 사용 가능한 대부분의 양자 컴퓨터는 NISQ(Noisy Intermediate-Scale Quantum, 노이즈가 있는 중간 규모 양자) 장치입니다. 실제 칩에는 게이트 오류, 결맞음 해제(decoherence), 크로스토크(cross-talk)가 만연해 있습니다. 이러한 환경에서는 하드웨어의 불완전함으로 인해 방법론이 무너진다면 이론적인 정교함은 아무런 의미가 없습니다.

테스트 결과에 따르면, QEWC는 노이즈가 존재하는 상황에서 클래식한 통합(consolidation) 방식보다 뛰어난 성능을 보입니다. 이는 단순히 사소한 부차적 결과가 아닙니다. 이론상으로만 작동하는 방식과 실제 물리적 장치와 접촉했을 때 살아남는 방식 사이의 차이를 의미합니다. 측정에 의존하는 클래식한 전략들은 판독값을 왜곡하는 동일한 노이즈 채널과 싸워야 합니다. 반면 QEWC는 노이즈가 섞인 측정 통계가 아닌 상태의 기하학적 구조로부터 중요도 가중치를 도출하기 때문에, 이러한 데이터 오염을 우회할 수 있습니다. 그 결과, 주변 큐비트들이 오작동하더라도 안정성을 유지하며 메모리를 보존하는 레이어를 구축할 수 있습니다.

시뮬레이션을 통한 증거

프레임워크를 검증하기 위해 연구팀은 표준 지속 학습(continual learning) 벤치마크에서 시뮬레이션을 수행했습니다. 모델은 손글씨 숫자를 인식하거나 의류 이미지를 분류하는 등의 작업을 학습하도록 요청받았는데, 이는 해당 분야에서 널리 쓰이는 클래식한 MNIST 및 Fashion-MNIST 데이터 분할 방식을 반영한 설정입니다. 첫 번째 작업에 대한 학습을 마친 후, 회로는 표준 조건과 QEWC 보호 조건 하에서 각각 두 번째 작업으로 넘어갔습니다.

표준 학습 방식이 프로세스를 주도했을 때는 나중에 수행한 작업이 이전의 성능을 완전히 무너뜨렸습니다. 회로는 심각한 파괴적 망각(catastrophic forgetting) 현상을 보였습니다. 하지만 QEWC 환경에서는 결과가 달라졌습니다. 보호된 파라미터는 숫자 인식 기하학적 구조를 유지하는 동시에, 자유 파라미터는 소매, 신발, 바지 등의 특징에 적응했습니다. 두 방식 사이의 격차는 상당했습니다. QEWC는 일반적인 학습 프로토콜에 비해 메모리 손실을 현저히 줄였습니다.

지속 학습이 게임의 판도를 바꾸는 이유

여기서 얻을 수 있는 장기적인 이점은 재시작 없는 지속 학습입니다. 현재 많은 양자 학습 파이프라인은 작업 분포가 변할 때 사실상 처음부터 다시 시작해야 합니다. 이러한 방식은 에너지와 시간, 그리고 양자 하드웨어의 한정된 결맞음(coherence) 자원을 낭비합니다. 만약 양자 시스템이 인간 엔지니어가 기술을 습득하듯—기존 지식을 지우지 않고 새로운 영역을 추가하며—지식을 축적할 수 있다면, 양자 머신러닝의 실용적 효용성은 비약적으로 확장될 것입니다.

양자 컴퓨터는 접근 비용이 비싸고 운용하기 까다롭습니다. 새로운 데이터셋이 나올 때마다 처음부터 다시 학습시키는 것은 상용화 단계에서 감당할 수 없는 사치입니다. QEWC는 단일 양자 모델이 진화하며, 새로운 과제를 맡을 때마다 유치원을 반복하는 대신 기존의 학습 내용을 계속 이어 나가는 시대를 향하고 있습니다.

주목해야 할 점

이 연구는 아직 시뮬레이션에 기반하고 있으므로, 진정한 시험대는 QEWC가 실제 초전도, 이온 트랩 또는 광학 하드웨어로 이식될 때가 될 것입니다. 그럼에도 불구하고, 이 개념적 전환은 매우 날카롭고 유용합니다. 양자 상태에 대한 기하학적 이해를 머신러닝의 실질적인 요구 사항과 결합함으로써, 이 연구는 양자 AI가 가장 기본적인 약점 중 하나를 극복할 수 있음을 시사합니다.

파괴적 망각은 학습 과정에서 피할 수 없는 대가가 아닙니다. QEWC는 무차별적인 측정이 아닌 양자 피셔 정보(Quantum Fisher Information)를 기반으로 구축된 적절한 수학적 구조가, 모델의 주의가 다른 곳으로 향하는 동안에도 양자 모델의 메모리를 온전하게 유지할 수 있음을 보여줍니다.

양자 컴퓨팅과 인공지능의 교차점을 추적하는 분들에게 이것은 팔로우할 가치가 있는 흐름입니다. https://t.me/GyaanSetuAi 에서 GyaanSetu AI 커뮤니티에 참여하여 최신 연구 소식을 받아보세요.