인공지능

Perplexity와 Nvidia, AI 에이전트를 로컬에서 실행하는 Portable Computer 출시

Perplexity가 사용자의 기기에서 에이전트를 로컬로 실행하는 Portable Computer 플랫폼을 출시했다. Nvidia DGX Spark와 최소 24GB 메모리의 RTX 그래픽카드를 탑재한 Linux 컴퓨터부터 지원한다. 이 시스템은 기본적으로 모델, 파일, 작업을 기기에 유지하며, 특정 단계를 더 강력한 클라우드 모델로 확장하기 전에 사용자 승인을 요청할 수 있다.

2026-08-25
4 분 읽기
10 조회수
فريق تحرير certi.news
Perplexity와 Nvidia, AI 에이전트를 로컬에서 실행하는 Portable Computer 출시

Perplexity는 2026년 8월 25일 에이전트 플랫폼 Computer의 로컬 버전인 Portable Computer를 출시했다고 발표했다. 이 제품은 AI 작업을 전적으로 클라우드에서 실행하는 대신 사용자가 보유한 하드웨어에서 실행하도록 설계됐다. 초기에는 Nvidia DGX Spark 컴퓨터와 Nvidia RTX 그래픽 처리 장치를 탑재한 Linux 기기에서 이용할 수 있으며, 회사는 Windows 지원이 9월에 추가될 예정이라고 밝혔다.

이 제품은 Pro, Max, Enterprise Pro, Enterprise Max 구독과 함께 작동한다. 최소 24GB의 비디오 메모리를 탑재한 RTX 카드가 필요하며, 이는 대략 GeForce RTX 3090 이상에 해당한다. 이 조건은 대부분의 소비자용 컴퓨터에서 플랫폼을 로컬로 실행할 수 없다는 뜻이지만, Perplexity는 이를 고급 에이전트를 직접 구성하는 것보다 간단하게 실행할 수 있는 방법으로 소개한다.

여러 설정 대신 하나의 로컬 패키지

Portable Computer는 하나의 애플리케이션에 로컬 모델, 추론 엔진, 작업 조정 에이전트, 도구, 애플리케이션 커넥터, 보안 격리 환경을 통합한다. 시스템은 문서 폴더를 검토하고, 데이터를 분석하며, 보고서를 작성하고, Google Drive, Gmail, GitHub 같은 서비스에 접근한 뒤, 이용 가능한 커넥터를 통해 결과를 Slack으로 보낼 수 있다.

회사가 진행한 시연에서 Qwen 3.8 27B 모델로 작동하는 에이전트는 DGX Spark에서 1099 양식과 투자 문서 모음을 검토하고 불필요한 수수료가 부과된 사례를 찾아냈다. 실행이 기기에서 이뤄졌기 때문에 클라우드 사용 크레딧 카운터는 0으로 유지됐다. Perplexity는 모든 작업이 로컬에서 시작되며, 사용자의 허가를 요청한 뒤에만 어떤 단계든 더 강력한 클라우드 모델로 넘어간다고 밝혔다.

로컬 모델과 에이전트를 위한 특수 설계

출시 시점에는 Qwen 3.8 27B와 Perplexity가 자체 에이전트 아키텍처에 맞도록 이후에 학습한 모델인 PPLX 27B를 이용할 수 있으며, Nvidia Nemotron 3.5 Lightning은 추후 추가될 예정이다. 플랫폼은 추론 호스팅에 vLLM을 사용하고, 고급 설정에서는 사용자가 자신의 추론 엔드포인트를 연결할 수 있다.

Perplexity는 로컬 모델과 에이전트 아키텍처를 함께 설계해야 한다는 개념을 바탕으로 한다. 회사가 발표한 연구 논문에 따르면 Qwen 3.8 27B 같은 모델은 260,000토큰의 컨텍스트 창을 제공한다고 발표했음에도 약 100,000토큰 이후 어려움을 겪기 시작한다. 이에 따라 회사는 간결한 시스템 프롬프트와 제한된 수의 도구, 필요할 때 불러오는 “스킬”을 채택했으며, 대규모 MCP 커넥터 대신 컨텍스트를 덜 소비하는 명령줄 도구를 사용했다.

플랫폼은 운영체제 수준의 격리를 항상 적용하며, 격리 환경을 사용할 수 없으면 사용자 전체 권한으로 도구를 실행하는 대신 스스로 중지한다. 클라우드 모델의 도움을 요청하면 시스템은 컨텍스트에서 개인 식별 정보를 검사하고 기기 밖으로 전송될 내용을 사용자에게 표시한다. 원격 모델은 텍스트 지침만 반환하며 로컬 파일이나 도구에는 접근하지 않는다.

실제로 무엇이 달라지는가?

가장 중요한 상업적 변화는 사용 비용이 소비된 토큰 수가 아니라 로컬 하드웨어의 성능으로 이동한다는 점이다. 문서 검토나 분석 반복 작업을 몇 시간 동안 수행하는 에이전트라도 로컬 실행 중에는 클라우드 사용 크레딧을 누적하지 않는다. 또한 데이터가 기기에 남아 있기 때문에 금융, 법률, 의료 관련 민감한 문서를 다루는 기관에도 도움이 될 수 있지만, 기기의 보안과 관리는 여전히 사용자 또는 기관의 책임이다.

Perplexity는 클라우드와 완전히 단절하는 대신 하이브리드 모델을 제시한다. Terminal Bench 2.1 테스트에서 로컬 Qwen은 약 0.415달러의 작업당 추정 비용으로 Claude Opus 5를 자문 역할로 활용했을 때 73.0%를 기록했으며, 활용 비용은 사실상 0에 가까웠다. 클라우드 모델만 사용했을 때는 0.65달러의 비용으로 82.4%를 기록했다.

회사는 53개 작업으로 구성된 자체 내부 평가 Local Knowledge Work Bench에서 Computer가 82.6%를 기록했다고 밝혔다. 같은 모델을 사용한 Pi 아키텍처는 77.6%, Hermes는 74.0%였으며, PPLX 27B를 사용하면 결과가 85.4%로 상승했다. 그러나 이러한 결과는 Perplexity 자체 평가에서 나온 것이므로 독립적인 검증이 필요하다. 회사도 로컬 모델이 여전히 어려운 추론에서는 고급 모델보다 낮은 성능을 보이며, 클라우드 확장이 격차를 줄이기는 하지만 완전히 해소하지는 못한다고 인정한다.

제약과 파트너십의 의미

이번 출시는 더 높은 개인정보 보호와 토큰별 과금 의존도 감소를 목표로 하는 Perplexity의 방향과, DGX Spark 같은 기기를 로컬 AI 실행을 위한 실용적인 도구로 만들려는 Nvidia의 목표를 연결한다. 두 회사는 2025년 6월 유럽의 출판사와 통신사를 위한 주권형 AI 모델과 관련한 협력을 발표한 바 있다.

그럼에도 출시 시점의 Portable Computer는 최소 비디오 메모리 요구 사항이 높은 Linux 및 Nvidia 하드웨어로 제한되며, Apple silicon 지원을 위한 발표된 경로도 없다. 따라서 이 제품은 클라우드 서비스나 Ollama 같은 도구를 대체하는 일반적인 제품이라기보다, 에이전트와 추론 계층 전체를 하나의 경험으로 포장하려는 시도에 가깝다. 개인정보 보호와 비용, 한편으로는 하드웨어 요구 사항과 일부 작업에서의 낮은 성능 사이에 명확한 절충이 존재한다.

뉴스 출처
VentureBeat Startups & Funding
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기