인공지능

GitHub, Copilot 내에서 여러 인공지능 모델을 조정하는 HydraFusion 테스트

GitHub는 프로그래밍 솔루션을 작성하고 검토하거나 더 강력한 모델로 에스컬레이션하기 위해 실행 중 여러 모델과 워크플로 중에서 선택하는 HydraFusion 프로젝트의 연구 프리뷰를 출시했다. 오프라인 테스트에서 이 시스템은 일부 비교에서 Claude Opus 5와 비슷하거나 더 나은 품질을 달성하면서 추정 비용을 낮췄다.

2026-09-04
4 분 읽기
10 조회수
فريق تحرير certi.news
GitHub, Copilot 내에서 여러 인공지능 모델을 조정하는 HydraFusion 테스트

GitHub는 2026년 9월 4일, 여러 공급업체의 인공지능 모델을 프로그래밍 작업 수행 중 조정하는 프로젝트인 Project HydraFusion을 발표했다. 이 프로젝트는 GitHub Copilot 내 연구 프리뷰로 제공된다. HydraFusion은 미리 하나의 모델을 선택하는 대신 실행 계획을 수립하고, 작업에 직접적인 해결책이 필요한지, 독립적인 검토가 필요한지, 아니면 더 역량이 뛰어난 모델로 에스컬레이션해야 하는지를 결정한다.

이번 조치는 GitHub가 올해 초 각 작업에 가장 적합한 모델을 선택하기 위해 출시한 Auto model selection 기능에 뒤이은 것이다. 그러나 HydraFusion은 이 개념을 모델 선택에서 전체 워크플로 구축으로 확장해 결과의 품질, 비용, 응답 시간을 균형 있게 조정한다. 한편 HydraFusion을 선택하는 개발자에게 운영상의 복잡성은 Copilot에서 다른 모델을 선택할 때와 마찬가지로 숨겨진다.

작업 실행을 위한 세 가지 경로

시스템은 추론, 코드 생성, 디버깅, 도구 사용과 관련된 신호를 평가한 다음 세 가지 실행 방식 중 하나를 선택한다.

  • Single: 하나의 모델이 해당 모델의 역량으로 충분한 경우 작업을 직접 해결한다.
  • Cascade: 더 효율적인 모델이 해결책 작성을 시작한 다음, 품질 게이트가 이를 채택할지 또는 작업을 더 강력한 모델로 넘길지를 결정한다.
  • Critique: 한 모델이 초안 해결책을 작성하면, 다른 계열의 독립적인 모델이 읽기 전용 컨텍스트에서 이를 검토한다. 이후 첫 번째 모델이 해결책을 한 차례 수정한다.

GitHub는 선택적 실행의 목적이 결과를 개선할 것으로 예상되는 경우에만 추가 호출을 사용하는 것이라고 설명한다. 이에 따라 직접 경로는 속도와 효율성을 유지하고, 다른 두 경로는 검토나 에스컬레이션의 이점을 얻을 수 있는 작업에 이를 추가한다.

테스트에서 나타난 결과

GitHub는 세 가지 프로그래밍 에이전트 벤치마크에서 HydraFusion의 고정 정책을 평가했다. 대상은 TerminalBench 2.1, DeepSWE, 그리고 GitHub Copilot의 실제 세션을 기반으로 구축된 내부 CheckpointBench였다. 결과는 Claude Opus 5와 GPT-5.6 Sol이라는 두 가지 기준선과 비교했으며, 입력, 도구, 실행 한도, 가격 책정 가정, 평가 조건은 동일하게 적용했다.

TerminalBench 2.1에서 HydraFusion은 검증된 작업 품질에서 4.9%포인트 향상을 기록했으며, Claude Opus 5와 비교해 워크플로의 추정 비용을 67% 낮췄다. 저장소 수준의 소프트웨어 엔지니어링 작업과 파일 간 의존성 이해에 초점을 맞춘 DeepSWE에서는 이 시스템이 Opus 5에 1.5%포인트 차이로 근접했고 비용은 36% 낮았다. CheckpointBench에서는 품질 차이가 0.1%포인트에 불과했으며 비용은 65% 절감됐다.

비용 산정에는 작성, 검토, 수정, 에스컬레이션, 재시도, 복귀 계획을 포함한 모든 실행 단계가 포함된다. 다만 GitHub는 이러한 결과가 오프라인 테스트이며, 사용된 테스트 버전, 워크플로 설정, 모델 집합, 가격 가정에 의해 한정된다고 설명한다.

운영 제어와 프리뷰의 한계

GitHub는 각 단계의 비용과 사용량 기록, 취소 및 실행 시간 제한, 도구를 보유하지 않고 저장소를 수정하지 않는 컨텍스트에서 검토 단계를 격리하는 제어 기능을 중심으로 HydraFusion을 설계했다. 또한 시스템은 워크플로 정의, 모델 연결, 대체 동작, 모델 가용성을 사전에 확인하며, 작업이 취소되거나 검증 작업이 실패하면 어떤 수정도 적용하지 않는다.

GitHub는 현재 한 번의 프롬프트로 Copilot의 자동 실행 모드에 전송하는, 규모가 크고 명확하게 정의된 프로그래밍 작업부터 시험을 시작할 것을 권장한다. 회사는 이후 여러 역할이 참여하는 장시간 세션의 성능 개선에 집중할 예정이다. 또한 프리뷰 기간에 모델, 워크플로, 이름, 가용성, 제품 동작이 변경될 수 있다고 안내한다.

편집자 해설: 모델 선택에서 워크플로 설계로

여기서 가장 중요한 변화는 새로운 모델을 추가하는 것이 아니라, 실행 결정을 개발자에서 조정 계층으로 옮기는 것이다. 이 계층은 한 번의 시도로 충분한지, 아니면 작업이 검토 또는 에스컬레이션 비용을 감수할 가치가 있는지를 결정한다. 테스트 결과가 실제 사용에서도 재현된다면, 개발자는 모든 요청에서 가장 강력한 모델의 비용을 지불하지 않고도 일부 작업에서 이에 가까운 품질을 얻을 수 있다.

그러나 이 수치는 아직 모든 프로그래밍 유형에서의 전반적인 우위를 입증하지 않는다. 특정 테스트, 통제된 정책, 오프라인 결과에 연관되어 있기 때문이다. 응답 시간, 신뢰성, 장시간 세션에서의 시스템 동작, 캐싱 효율성, 안전성에 관한 질문은 여전히 남아 있으며, GitHub는 프리뷰 기간 동안 이러한 측면을 측정하겠다고 밝혔다.

뉴스 출처
GitHub Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기