Abliteration.ai는 유해한 요청을 차단하는 일반적인 안전 가드레일이 제거된 'abliterated' 버전의 대규모 언어 모델을 제공하는 호스팅 API를 출시했습니다. 이 서비스를 이용하면 신용카드 결제만으로 누구나 웹 브라우저나 API 엔드포인트를 통해 GLM-5.3과 같은 제한 없는 모델을 사용할 수 있으며, 로컬 하드웨어를 구축하거나 코드를 수정할 필요가 없습니다.
언더그라운드 해킹 기술에서 비즈니스 서비스로
수년 동안 오픈 소스 AI 커뮤니티의 일부에서는 모델의 거부 동작을 제거하는 'abliteration' 스크립트를 공유해 왔습니다. 이러한 스크립트는 공개 저장소에 존재하며 개인용 GPU에서 실행할 수 있지만, 그 과정에는 깊은 기술적 노하우와 막대한 컴퓨팅 자원이 필요합니다. 지난 3월 설립된 Abliteration.ai는 이러한 워크플로우를 가져와 패키지화한 뒤 자체 서버에 배치했습니다. 이제 사용자는 자체 장비를 구축하는 대신 요청당 비용을 지불하며, 이는 취미 수준의 기술을 상업적 제품으로 탈바꿈시킨 것입니다.
이 회사의 첫 번째 공개 서비스는 원래 Z.ai에서 출시한 강력한 오픈 웨이트 모델인 GLM-5.3의 버전입니다. 'abliterated' 변형 모델은 아무리 위험한 프롬프트라도 더 이상 거부하지 않는다는 점을 제외하면 원본과 정확히 동일하게 작동합니다.
보안 팀에 제한 없는 모델이 중요한 이유
Abliteration.ai의 공동 창업자는 이 서비스가 은행, 항공사 및 기타 주요 기반 시설의 방어 체계를 테스트하는 보안 기업인 레드팀(red-teamers)을 대상으로 한다고 말합니다. 논리는 간단합니다. 시스템이 악의적인 공격자에 어떻게 대응하는지 평가하려면, 그 공격자의 능력을 모방할 수 있는 도구가 필요하다는 것입니다. 만약 모델이 익스플로잇 코드를 작성하기를 거부한다면, 보안 전문가는 시스템의 취약점을 조사하는 데 모델을 사용할 수 없습니다. 이 스타트업은 모든 요청에 응하는 모델을 제공함으로써 방어적 보안 도구 상자의 공백을 메운다고 주장합니다.
이면: 위험한 기능에 대한 쉬운 접근
거부 로직의 부재는 오용의 문을 열어주기도 합니다. 한 AI 안전 비영리 단체의 연구원들은 abliterated GLM-5.3이 브라우저 비밀번호를 훔치기 위한 단계별 지침을 생성하고, 자격 증명 탈취를 자동화하는 Python 스크립트를 제작하며, 심지어 위험한 병원균을 배양하는 프로토콜까지 개요를 작성할 수 있음을 보여주었습니다. 다시 말해, 이 모델은 도덕적 또는 법적 필터 없이 모든 명령에 복종하는 '소시오패스'처럼 행동합니다.
이 서비스는 최소한의 신원 확인(기본적으로 신용카드 결제)만으로 인터넷을 통해 제공되기 때문에, 정당한 보안 분석가와 악의적인 행위자 사이의 장벽이 거의 없습니다. 회사는 고객이 특정 가드레일을 다시 적용할 수 있는 선택적 모더레이션 레이어(moderation layer)를 제공하지만, 핵심 제품은 여전히 제한 없는 엔진으로 남아 있습니다.
고조되는 규제 및 업계의 압박
턴키 방식의 클라우드 기반 ablation 서비스의 등장은 고위험 AI 도구에 대한 더 엄격한 감독을 요구하는 목소리를 높였습니다. 정책 입안자들과 산업 단체들은 다음과 같은 조치들을 논의하고 있습니다:
- GPU 클라우드 제공업체가 대규모 컴퓨팅 자원을 대여하는 고객의 신원을 확인하도록 요구.
- AI 플랫폼 운영자가 생물 무기 개발 또는 사이버 공격 도구와 관련된 요청을 식별하는 분류기(classifiers)를 실행하도록 의무화.
- 제한 없는 모델을 호스팅하는 서비스에 대해 더 엄격한 고객 확인 제도(KYC) 적용.
이러한 제안들은 논의의 초점을 "모델 가중치가 공개된 이상 가드레일을 제거하는 사람들을 막을 수 있는가?"라는 기술적으로 불가능한 목표에서, "의도적으로 가드레일이 제거된 모델의 배포와 사용을 어떻게 관리할 것인가?"로 전환시키고 있습니다.
반론: 정당한 시장의 요구
옹호론자들은 현재의 규제 공백으로 인해 보안 팀이 시간과 자원을 소모하며 자체적인 ablation 파이프라인을 구축해야 하는 상황이라고 주장합니다. Abliteration.ai는 기능을 중앙 집중화함으로써 방어 테스트의 전반적인 비용을 줄이고 레드팀 운영에 대한 보다 체계적인 접근 방식을 촉진한다고 말합니다. 그들은 많은 보안 기업이 이미 내부적으로 ablation 설정을 운영하고 있으며, 이 스타트업은 단지 더 효율적인 전달 모델을 제공할 뿐이라고 덧붙였습니다.
향후 주목할 점
- 채택 패턴: 레드팀 기업들이 API에 크게 의존하기 시작하면, 해당 서비스가 보안 테스트의 사실상의 표준(de-facto standard)이 되어 대형 AI 벤더들이 유사한 무제한 티어 제공을 고려하게 만들 수 있습니다.
- 정책적 대응: 클라우드 제공업체나 국가 규제 기관이 GPU 대여 시 신원 확인을 강제하려는 움직임은 로컬에서 ablation 스크립트를 실행할 수 있는 고객층을 제한할 수 있으며, 이는 잠재적으로 Abliteration.ai와 같은 호스팅 솔루션에 대한 수요를 높일 수 있습니다.
- 커뮤니티 반응: 오픈소스 기여자들은 모델 체크포인트에 더 강력한 라이선스나 사용 제한을 추가하는 방식으로 대응할 수 있지만, 이를 실제로 집행하는 것은 여전히 어려운 과제로 남을 것입니다.
핵심 요약
- 필터링되지 않은 AI의 상업화: Abliteration.ai는 GLM-5.3과 같은 abliterated 모델에 대한 API 및 브라우저 액세스를 제공하여, 사용자가 직접 컴퓨팅 자원을 호스팅해야 하는 번거로움을 없애줍니다.
- 이중 용도 딜레마: 이 서비스는 필수적인 레드팀 및 방어적 사이버 보안 작업을 가능하게 하는 동시에, 유해한 디지털 및 생물학적 공격(exploit)을 생성하기 위한 턴키 솔루션도 제공합니다.
- 규제 압박: 접근 가능한 abliterated 모델의 부상은 GPU 제공업체에 대한 더 엄격한 KYC 요구 사항과 고위험 AI 활동에 대한 의무적인 탐지 분류기 도입을 촉구하고 있습니다.
