Microsoft에 따르면 Frontier Offensive Research & Generative Exploitation, 약칭 FORGE 연구소는 AI가 발견하기 어려운 취약점을 찾아낼 수 있는지 시험하는 단계에서, 이러한 발견을 출시 가능한 수정 사항으로 전환하려면 무엇이 필요한지를 연구하는 단계로 넘어갔다. 2026년 5월부터 9월 사이에 이 연구소는 Windows에서 취약점 발견을 지원했으며, 이 취약점들에는 140개의 CVE 식별자가 할당되었고, 그중 52개는 2026년 9월 보안 업데이트에 포함되어 해결되었다.
작업은 오픈 소스 소프트웨어로도 확대되었다. FORGE 팀은 Linux 커널을 포함한 23개 프로젝트에 걸쳐 내부적으로 검증된 약 155건의 보고서를 제출했다. Microsoft에 따르면 자료 작성 당시 14개 프로젝트 또는 프로젝트군에 걸친 93건의 보고서가 관리자로부터 확인 또는 문서화된 수락을 받았다. 또한 Linux Foundation의 Akrites 이니셔티브를 통해 제출된 Linux 보고서 중 하나는 해당 이니셔티브의 보고서로는 처음으로 Linux 커널에 수정 사항이 통합되는 결과로 이어졌다.
최대 역량에서 대규모 운영으로
첫 번째 교훈은 복잡한 결함을 찾아내는 모델의 성공이 같은 속도로 수정 사항을 생산할 수 있음을 보장하지 않는다는 것이다. 검증자의 수를 늘리면 후보의 수는 증가할 수 있지만, 확인된 결과나 게시된 수정 사항의 수가 반드시 늘어나는 것은 아니다. 보고서가 Microsoft Security Response Center의 검토 능력보다 빠르게 유입되면 대기 목록이 쌓여 전문가의 시간을 소모하며, 특히 보고서가 중복되거나 재현 가능한 증거가 부족할 때 이러한 문제가 두드러진다.
따라서 FORGE는 단순한 검사 또는 보고서 수가 아니라 재현 가능한 결과에 초점을 맞춘다. 연구소는 작업을 조율하기 위해 다중 모델 플랫폼인 MDASH를 사용하며, 악용 가능성 증명 또는 개념 증명 생성기, 테스트 도구 구축, 결함 동작을 유발하는 입력 탐색 기능도 함께 활용한다. Microsoft는 추상 구문 트리 분석과 같은 결정론적 알고리즘을 도입한 한 내부 프로젝트에서 동일한 코드에 대한 여러 차례의 검사 과정에서 중복 보고서가 약 45% 감소했다고 밝혔다.
텍스트 증가가 아니라 불확실성 제거에 투자하기
Microsoft는 효율성을 모델이 생성하는 토큰 수만으로 측정하면 오해를 낳는 지표가 된다고 본다. 짧은 보고서는 모호하여 조사 비용이 많이 들 수 있는 반면, 더 긴 분석은 실행 경로를 뒷받침하고 전체 비용을 줄일 수 있다. 실무적인 판단은 조사자에게 부족한 것이 무엇인지, 즉 함수 호출자, 빌드 설정, 실행 가능한 재현기, 인과적 설명 중 무엇인지를 파악한 뒤 다음 단계를 정확히 그 공백을 메우는 데 맞추는 것이다.
MDASH는 고급 모델과 증류 모델, 전문 검증자, 코드 분석 도구를 결합하며, 반복적인 작업은 비용이 낮은 모델로 보내고 해결되지 않은 질문은 더 강력한 모델로 에스컬레이션할 수 있다. 그러나 Microsoft는 초기 필터링이 실제 취약점을 배제할 수 있으므로 이 정책은 여전히 측정이 필요한 가설이라고 강조한다.
지속적인 학습 루프로서의 검증과 수정
이 관점에 따르면 검증과 수정을 취약점 발견 이후의 단계로 취급해서는 안 된다. 모든 결과는 자동 검증, 사람의 검토, 수정 사항 개발, 회귀 테스트를 거쳐야 하며 각 단계의 증거를 시스템에 다시 반영해야 한다. 경로에 접근할 수 없거나, 빌드 설정이 잘못되었거나, 공격자가 입력을 제어할 수 없거나, 보고서가 중복되는 등 검증 실패의 원인을 기록한다면 검증 실패조차 유용할 수 있다.
Linux 커널을 대상으로 한 실험에서 검증 에이전트는 627건의 결과에 대한 보조 증거를 생성했다. 한편 확인된 충돌 182건에 대한 개념 증명을 만드는 데 든 평균 비용은 모델 비용 3.61달러, 성공 사례당 21.5분이었다. 자동화된 익스플로잇 생성을 통해 로컬 권한 상승 가능성을 시험한 6건에서는 평균 8.56달러와 25.4분이 소요되었다. 평가에는 GPT-5.5가 사용되었으며, 초기 검사 비용이나 실패 사례, 사람의 조사 및 수정 사항 작성 비용은 포함되지 않았다.
보안 팀에 이것이 의미하는 것
이 결과에서 얻을 수 있는 가장 중요한 해석은 에이전트형 취약점 발견 시스템의 성공 지표가 결과 수에서 멈춰서는 안 된다는 것이다. Microsoft는 확인된 결함 수, 중복 및 거부된 보고서, 대기 목록의 경과 기간, 발견에서 수정까지의 전환 시간과 함께 모델 비용 및 사람의 검토 시간을 추적할 것을 제안한다. 또한 오픈 소스 프로젝트에서 작업할 때는 더 많은 보고서를 보내는 데 그치지 말고 각 프로젝트의 공개, 검토 및 수정 절차를 존중해야 한다.
실질적으로 이 자료는 병목 지점의 변화를 보여준다. 결함을 찾는 능력은 문제의 일부가 되었고, 연구를 빌드 환경, 바이너리, 설정, 테스트 도구 및 CI/CD 시스템과 연결하는 일이 점점 더 중요해지고 있다. 결과의 한계도 분명하다. 검증 비용에 관한 수치는 중요한 사람의 작업 단계를 제외하며, 연구 결과를 수용 가능한 수정 사항으로 전환하는 일은 관리자와 각 프로젝트의 맥락에 달려 있다. 따라서 이 자료는 자동화가 엔지니어링 검토를 대체한다고 입증하는 것이 아니라, 보안 판단과 수정에 대한 책임은 사람에게 남겨 둔 채 반복 작업을 줄이는 수단으로 자동화를 제시한다.