인공지능

OpenAI, 일상 업무를 위한 AI 에이전트에 베팅하다: 사용자들은 이들을 신뢰할까?

OpenAI는 ChatGPT Work를 통해 AI 에이전트를 프로그래밍 환경에서 회계, 투자, 의료 및 기타 사무직 업무로 확장하려 한다. 그러나 사용 확대는 제품이 권한을 관리하고, 작업 단계를 설명하며, 전략·프레젠테이션·영업처럼 평가하기 어려운 업무를 신뢰성 있게 수행할 수 있는지에 달려 있다.

2026-08-24
5 분 읽기
11 조회수
فريق تحرير certi.news
OpenAI, 일상 업무를 위한 AI 에이전트에 베팅하다: 사용자들은 이들을 신뢰할까?

OpenAI는 지난달 출시한 사무직 근로자 대상 버전인 ChatGPT Work를 통해 AI 에이전트를 코드 작성 이상의 영역으로 확장하고 있다. 이 서비스는 회사의 가장 낮은 구독 등급에 포함되며 월 20달러에 이용할 수 있다. 핵심은 모델이 질문에 답하는 데 그치지 않고, 사용자를 대신해 이메일, 업무 도구 및 클라우드 플랫폼을 활용하여 여러 단계로 구성된 프로젝트를 수행하는 것이다.

이러한 방향은 OpenAI의 상업적·제품적 측면에서 가장 큰 베팅이지만, 모델 자체를 개선하는 것보다 더 어려운 질문을 회사에 던진다. 사용자는 자동화된 에이전트에 디지털 생활에 대한 통제권을 얼마나 기꺼이 맡길 것인가? 에이전트가 유용한 작업을 수행하려면 이메일, Slack, Notion, Figma 및 캘린더 같은 정보원에 접근해야 하며, 이들 안에서 변경을 실행할 권한을 가질 수도 있다. 이러한 권한은 도구의 가치를 높이지만, 개인정보가 노출되거나 의도하지 않은 조치가 실행될 위험도 키운다.

개발자 도구에서 다른 직무로

ChatGPT Work는 코드 작성 도구인 Codex의 수정 버전을 기반으로 구축됐다. OpenAI는 목표가 비개발자에게 개발자들이 사용하기 시작한 유형의 역량을 제공하는 것이라고 말한다. 즉, 답변을 생성하는 데 그치지 않고 거의 독립적으로 전체 작업을 수행할 수 있는 도구다. 기사에서 소개된 현재 사용 사례에는 지표에 관한 주간 보고서 작성, 스프레드시트를 계획 수립 도구로 전환, 기업 정보를 투자 메모로 정리, 추적 대시보드와 차트 생성 등이 포함된다.

이러한 확장이 중요한 이유는 AI 개발사들이 훈련과 컴퓨팅에 대한 막대한 투자를 정당화하기 위해 소프트웨어 부문에만 의존할 수 없기 때문이다. 더 긴 작업은 더 많은 토큰을 소비하고, 새로운 전문 분야에 접근하면 더 넓은 시장이 열린다. 반면 Harvey는 법률 분야에서, Clay는 영업 분야에서 특정 모델에 종속되지 않는 접근 방식으로 같은 고객을 겨냥하고 있다.

OpenAI 안팎의 사용 수치는 회사가 메우려는 격차를 보여준다. OpenAI의 지원을 받은 연구에 따르면 6월에 회사 직원의 98%가 Codex를 사용했지만, 조직 구독자는 17%, 개인 구독자는 1% 미만에 그쳤다. 또한 회사는 Codex와 비교한 Work 사용자 수를 공개하지 않았다. 기사에 따르면 OpenAI의 공동 애플리케이션은 약 2,000만 명이 사용하고 있으며, OpenAI는 인터넷을 통해 10억 명이 넘는 사용자가 ChatGPT와 상호작용한다고 말한다.

실제로 무엇이 달라지는가?

에이전트는 엔지니어들이 ‘하니스(harness)’라고 부르는 것에 의존한다. 이는 모델이 볼 수 있는 정보, 사용할 수 있는 도구 및 결과가 표시되는 방식을 정하는 소프트웨어 계층이다. 프로그래밍 도구에서는 일부 사용자에게 명령줄만으로 충분했다. 그러나 더 넓은 대중에게는 복잡성을 감추고 에이전트가 할 수 있는 일과 작업을 시작하는 방법을 명확히 보여주는 인터페이스가 필요하다.

기사의 실험은 효용과 마찰을 동시에 보여준다. ChatGPT Work는 이메일에 있던 비정형 형식의 학교 캘린더를 Google Calendar로 옮기고, 상장 기업 지표를 자동으로 업데이트하는 대시보드를 만들며, 우주 발사에 관한 검색 가능한 데이터베이스를 구축하고, 새로운 AI 연구에 대한 주간 메시지를 보내는 데 성공했다. 그러나 클라우드 저장소에 접근하기 위한 권한 설정은 혼란스러웠고, 사용자가 도구에 읽기 전용 권한을 부여하는 방법도 명확하지 않았다. 나중에 해당 작업에는 전체 접근 권한이 필요하다는 사실이 드러났다.

일부 설정은 웹 앱을 통해서만 이용할 수 있어 사용자는 웹 앱과 모바일 앱 사이를 오가야 한다. Google Calendar에 이벤트를 생성할 수는 있지만 새 캘린더를 만들 수 없는 등 실무적인 제약도 있다. 또한 사용자가 낮은 작업 수준을 선택하면 작업 결과가 좋지 않을 수 있다. OpenAI의 한 엔지니어가 인정했듯이 사고 수준도 신규 사용자에게 충분히 이해하기 쉬워 보이지 않는다.

신뢰와 평가가 다음 장애물이다

문제는 인터페이스에만 있지 않다. 소프트웨어는 대체로 “작동하는가, 작동하지 않는가?”라는 직접적인 질문으로 테스트할 수 있다. 하지만 좋은 프레젠테이션이나 사업 전략 또는 영업 제안을 평가하는 일은 덜 명확하고 추적하기도 어렵다. 이에 OpenAI는 사용자 피드백과 함께 44개 직업의 지식 노동 테스트를 기반으로 한 GDPval 기준을 사용한다고 밝혔다. 회사는 자신이 대부분의 사람에게 필요한 업무 흐름을 구축하고 있는지, 아니면 전문 직원에게만 적합한 업무 흐름을 구축하고 있는지를 판단해야 하는 과제에 여전히 직면해 있다.

권한은 의존의 한계에 관한 질문도 제기한다. OpenAI의 한 수석 엔지니어는 자신의 이메일, Slack 계정, 휴대전화 및 기타 애플리케이션을 연결해 애플리케이션을 테스트했지만, 시스템이 비공개 메시지에서 정보를 추출한 뒤 해당 정보가 포함되어서는 안 되는 문서에 사용할 가능성이 있음을 인정했다. 반면 기사 작성자는 도구가 덜 민감한 작업에서는 유용하다고 판단했지만, 자신의 이메일, 은행 계좌 또는 업무 초안에는 접근 권한을 부여하지 않았다.

모델과 하니스 사이의 경쟁

ChatGPT Work는 Claude Cowork와 일반 사용자를 겨냥한 다른 에이전트 도구들과 유사하다. 기사에 따르면 Claude Code는 Codex보다 먼저 대화형 방식을 도입했다. 사용자가 여러 선택지 중 경로를 고르고 연속적인 업데이트를 받을 수 있는 방식이었다. 이후 OpenAI는 Codex에 더 많은 상호작용 지점을 추가하고 데스크톱 및 모바일 애플리케이션을 개발했다. 다운로드 통계에 따르면 올해 4월까지는 Claude Code가 더 많은 수요를 보였지만, 이후 Codex가 근소한 차이로 앞섰다.

OpenAI는 최신 모델의 성능과 비용 효율성이 핵심적인 차이라고 본다. 반면 연구자와 사용자들은 하니스의 설계와 검토 및 비교를 쉽게 요청할 수 있는 기능도 그에 못지않게 중요하다고 본다. 질문은 여전히 열려 있다. 강력한 범용 모델이 전문 도구와 지침을 점진적으로 대체할 수 있을까, 아니면 사용자는 더 설명적이고 통제 가능한 인터페이스를 계속 필요로 할까? 답은 AI 에이전트가 얼리 어답터를 위한 인상적인 도구에서 사무직 업무의 일상적인 계층으로 전환될 수 있을지를 결정할 것이다.

뉴스 출처
TechCrunch AI
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기