클라우드 컴퓨팅 및 데이터 센터

NVIDIA와 CoreWeave, 에이전틱 AI 인프라의 프로덕션 전환 추진

CoreWeave가 NVIDIA Vera Rubin NVL72 시스템과 Spectrum-X 네트워크를 제공하고, 모델 학습·평가·프로덕션 운영을 연결하는 새로운 서비스를 출시한다고 발표했다. Cognition의 테스트에서는 소프트웨어 엔지니어링 워크로드에서 GB200 NVL72 플랫폼과 비교해 총 토큰 생성률이 최대 4.8배 증가한 것으로 나타났다.

2026-09-30
3 분 읽기
5 조회수
certi.news Editorial Team
NVIDIA와 CoreWeave, 에이전틱 AI 인프라의 프로덕션 전환 추진

CoreWeave는 NVIDIA Vera Rubin NVL72 시스템을 클라우드 플랫폼에서 제공한다고 발표했다. 이 시스템은 Spectrum-X 102.4T Ethernet 네트워크를 기반으로 하며, 에이전틱 AI 워크로드를 학습과 실험 단계에서 프로덕션 운영으로 전환하는 것을 목표로 한다. 회사에 따르면 에이전틱 소프트웨어 엔지니어 Devin을 개발한 Cognition은 Vera Rubin에서 프로덕션 워크로드를 실행하는 첫 번째 고객이 됐다.

이번 발표는 샌프란시스코에서 열린 CoreWeave Fully Connected 행사에서 나왔으며, AI 에이전트 워크로드에 맞게 설계된 NVIDIA Vera 프로세서의 제공 계획과 학습, 평가, 모델 및 에이전트의 지속적인 최적화를 연결하는 CoreWeave Forge 환경의 출시도 포함한다.

Devin 워크로드의 향상된 성능

Cognition은 Devin 학습과 강화학습 수행, 프로덕션 추론 실행을 위해 CoreWeave 인프라를 사용한다. CoreWeave가 첫 번째 Vera Rubin NVL72 프로덕션 랙을 인수한 뒤, Cognition은 FrontierCode에서 가져온 소프트웨어 엔지니어링 작업 모음을 사용해 성능을 비교하고 이를 해결할 에이전트를 배포했다.

초기 테스트에서는 SWE-2 추론 워크로드의 총 토큰 생성률이 GB200 NVL72 기준선과 비교해 최대 4.8배 증가한 것으로 나타났다. 소스에 따르면 실제로 이는 더 빠른 코드 생성과 Devin의 다단계 추론 과정에서 향상된 응답성을 의미한다. 다만 서로 다른 환경 간 수치의 비교 가능성을 판단할 수 있는 전체 측정 방법론이나 테스트 조건에 관한 세부 정보는 본문에 충분히 제시되지 않았다.

AI 수명주기를 위한 단일 플랫폼

CoreWeave는 CoreWeave Kubernetes Service, SUNK, CoreWeave Mission Control, CoreWeave Sandboxes 및 CoreWeave Inference를 통해 Vera Rubin 용량을 운영할 수 있도록 한다. 또한 CoreWeave Forge가 Weights & Biases의 도구, OpenPipe의 포스트 트레이닝 전문 지식, 오픈 소스 프로젝트 marimo를 하나의 환경으로 통합한다고 발표했다. 이 환경은 다양한 모델, 프레임워크 및 클라우드에 계속 개방된다.

Forge에는 실험을 분석하고 수정 사항을 제안하며 이를 GitHub에 저장하는 일반 제공 서비스 CoreWeave ARIA와, 프로덕션 에이전트 모니터링 데이터를 최적화를 위한 입력으로 전환하는 새로운 서비스 CoreWeave Agent Lens가 포함된다. CoreWeave는 Agent Lens가 실패 감지율을 20% 향상하고 실패 수정 비용을 절반으로 줄였다고 말하지만, 이러한 비율을 산출한 방법에 관한 독립적인 세부 정보는 제시하지 않았다.

CoreWeave Sandboxes도 에이전트, 도구 호출, 강화학습 및 평가를 CPU 또는 GPU에서 격리된 환경 안에서 실행할 수 있도록 일반 제공된다. 회사는 서버리스 강화학습이 자체 관리형 구성보다 1.4배 빠르고 비용은 40% 낮다고 말한다.

실제로 무엇이 바뀌는가?

가장 중요한 변화는 단순히 새로운 하드웨어를 추가하는 데 있지 않으며, 에이전트 실행과 그 신호 수집, 이후 학습에서의 재사용 사이의 간극을 줄이려는 시도에 있다. 오픈 소스 추론 프레임워크인 NVIDIA Dynamo는 관리형 추론 서비스와 비공개 프리뷰 단계에 있는 RL Rollouts 기능을 지원한다. 이 기능은 재배포 없이 새로운 체크포인트를 라이브 배포에 불러올 수 있다.

CoreWeave는 Vera 프로세서가 하나의 랙에 128개의 CPU와 11,264개의 코어를 배치할 수 있으며, 환경당 코어 하나를 할당할 경우 11,000개 이상의 동시 환경을 처리할 수 있다고 말한다. 테스트에서는 에이전트 환경의 시작 과정이 3배 이상 빨라졌고, Terminal-Bench의 성공 작업 전반에서 프로세서가 1.7배의 성능 향상을 기록했다.

Canva, Capital One 및 MasterClass는 Forge를 사용하고 있으며, Ennoble Care는 임상 AI 추론을 실행하기 위해 NVIDIA RTX PRO 6000의 예약 용량을 선택했다. 그러나 여기 제시된 성능 및 비용 수치의 대부분은 CoreWeave 또는 그 고객들이 제공한 것이므로, 모든 에이전틱 AI 워크로드에 대한 일반적인 지표로 간주하기 전에 독립적인 검토가 필요하다.

뉴스 출처
NVIDIA AI Blog
원문 보기 ↗
c
작성자

certi.news Editorial Team

같은 카테고리

추천 기사

모든 뉴스 보기