Abliteration.ai가 고급 모델의 수정 버전을 호스팅하고 브라우저나 API를 통해 사용할 수 있게 하는 플랫폼을 출시하면서, 오픈 웨이트 인공지능 모델의 안전장벽 제거가 직접적인 상업 서비스로 제공되기 시작했습니다. 이 플랫폼에는 최근 Z.ai가 출시한 GLM-5.3 모델의 버전도 포함되어 있으며, 유해한 요청의 실행을 거부하는 성향이 제거되었습니다.
이 서비스는 ‘abliteration’으로 알려진 기술을 기반으로 합니다. 이는 수년 전부터 오픈 웨이트 모델을 다루는 연구자와 개발자 사이에서 사용되어 온 방식입니다. Hugging Face에는 이러한 방식으로 수정된 모델이 수천 개 존재하지만, Abliteration.ai는 모델을 내려받고 실행에 필요한 컴퓨팅 인프라를 마련해야 하는 환경에서 벗어나, 사용자들의 장벽을 낮춘 즉시 사용 가능한 서비스로 이 방식을 제공합니다.
보안상의 명분과 병행되는 위험
회사는 승인된 공격적 사이버 보안 업무, 레드팀 테스트, 에이전트 테스트를 지원하는 것이 목표라고 말합니다. 이러한 업무는 다른 모델이 실행을 거부할 수 있습니다. 회사가 내세우는 논리는 방어 분야에서 분명합니다. 팀이 재현할 수 없는 행동은 테스트할 수 없으며, 효과적인 익스플로잇 코드를 생성하기를 거부하는 모델은 실제 공격자를 모의할 때 유용성이 떨어질 수 있다는 것입니다.
그러나 거부 기능을 제거한다고 해서 보안 연구자와 악의적인 의도를 가진 사용자가 자동으로 구분되는 것은 아닙니다. TechCrunch가 실시한 테스트에서 수정된 모델은 Chrome에 저장된 비밀번호를 훔치는 요청과 위험한 인간 병원체의 배양에 관한 정보를 생성하는 요청에 응답했습니다. 이 결과는 요청에 대한 실행 절차를 공개하지 않지만, 제거된 장벽이 형식적인 것만은 아니었음을 실제로 보여줍니다.
스타트업과 아직 완성되지 않은 통제 장치
Abliteration.ai는 지난해 말 설립되었으며 3월에 공식적으로 등록되었습니다. 공동 창업자인 Devon은 회사가 여러 클라우드 서비스 제공업체와 계약을 체결했고 고객 수익으로 운영 자금을 조달하고 있으며, 지금까지 벤처캐피털 투자는 받지 않았지만 이와 관련한 논의를 진행 중이라고 말했습니다. 해당 출처는 Devon이 여전히 다른 회사에 근무하고 있기 때문에 그의 전체 이름을 공개하지 않았습니다.
플랫폼은 고객이 원하는 장벽을 추가할 수 있는 선택적 조정 계층을 제공하며, 플랫폼 자체에도 일부 제한이 포함되어 있습니다. Devon은 폭력을 방지하기 위한 통제 장치를 추가하는 작업을 진행 중이라고 말했지만, 회사는 현재 결제에 사용된 신용카드 등록을 넘어서는 고객확인제도(KYC)를 시행하지 않고 있습니다.
실제로 무엇이 달라지는가?
Devon에 따르면 회사의 고객에는 영국과 유럽에서 레드팀 테스트를 수행하는 스타트업들이 포함되어 있으며, 이들은 은행, 항공사 및 핵심 인프라와 관련된 기타 기관을 지원합니다. 그는 방어 담당자에게 공격자가 사용할 수 있는 것과 유사한 도구를 제공하면 에이전트와 방어 시스템의 테스트를 가속할 수 있다고 봅니다.
그러나 이러한 평가는 합의된 견해가 아닙니다. Fabraix의 최고경영자 Ahmed Aly는 자사가 오픈 모델의 미세 조정에 더 크게 의존하며, 장벽 제거가 일부 지식과 능력을 감소시킬 수 있다고 말했습니다. Safe Intelligence의 Alessio Lomuscio는 수정된 모델이 스트레스 테스트 중 특정 행동을 유발하는 데 유용할 수 있다고 보았습니다. 한편 Armadin의 David Slater는 자사가 현재 이를 사용하지 않지만 해당 기술에 대한 연구는 계속하고 있다고 말했습니다.
열린 거버넌스의 문제
이 서비스는 기술만으로 해결하기 어려운 역설을 드러냅니다. 제한이 없는 모델을 제공하면 방어 담당자가 피해를 이해하는 데 도움이 될 수 있지만, 동시에 악용될 수 있는 능력에 접근하는 비용도 낮아집니다. CivAI의 Andrew Yoon은 정부가 서비스 제공업체에 사이버 보안과 생물학적 무기 분야의 유해 활동을 탐지하는 분류기를 운영하도록 의무화하고, 고급 GPU 인스턴스를 임대하는 업체에 고객 신원 확인을 실시하며 오용 징후가 있을 경우 접근을 거부하도록 요구해야 한다고 제안했습니다.
여기서 가장 중요한 사실은 장벽 제거가 가능하다는 점이 아닙니다. 이는 오픈 모델 커뮤니티에 이미 알려져 있습니다. 새로운 점은 책임 소재를 규정하고 고객을 확인하며 방어적 사용의 한계를 정하는 규칙이 완성되기 전에 이를 사용하기 쉬운 호스팅 서비스로 전환했다는 것입니다. 특히 미세 조정과 같은 대안이 존재하고, 그 과정 자체가 모델의 일부 능력을 감소시킬 가능성이 있는 만큼, 보안 테스트에서의 실제 영향은 계속 논쟁의 대상이 될 것입니다.