인공지능을 더 이상 따라가기 위해 모델과 알고리즘만 이해하면 되는 것은 아닙니다. 빠르게 변화하는 약어와 새로운 기술 개념으로 이루어진 용어 사전도 해독해야 합니다. 이 가이드는 스마트 어시스턴트와 생성형 모델 뒤에서 무슨 일이 일어나는지 이해하는 데 개발자, 제품 팀, 기술 독자에게 필요한 주요 용어를 모았습니다.
이러한 개념은 학습, 추론, 가중치와 같은 기본 개념부터 인공지능 에이전트와 Model Context Protocol처럼 더욱 최근에 등장한 응용 분야와 관련된 개념까지 다양합니다. 또한 이 가이드는 모델의 효율성과 관찰 가능성에 관한 최근 논의에서 등장한 용어인 ‘불투명 추론’(Opaque recurrence)도 다룹니다.
모델을 구축하고 실행하는 개념
대규모 언어 모델(LLM)은 방대한 양의 책, 기사, 텍스트에서 단어와 문장 사이의 관계를 학습하는 심층 신경망 모델입니다. 요청을 받으면 모델은 그 요청에 부합할 가능성이 가장 높은 패턴을 생성합니다. 이러한 모델은 ChatGPT, Claude, Google Gemini, Meta AI Llama, Microsoft Copilot, Mistral Le Chat에서 사용됩니다.
학습은 모델이 데이터에서 패턴을 배우는 과정이며, 추론은 모델이 학습한 내용을 바탕으로 예측이나 답변을 생성하도록 실행하는 것을 의미합니다. 휴대전화 프로세서부터 GPU와 인공지능 가속기에 이르는 추론용 하드웨어는 모델 실행 속도와 대규모 모델을 처리하는 능력에 영향을 미칩니다.
가중치는 모델 내부의 다양한 특성이 갖는 중요도를 결정하며, 학습 중에 변경되어 출력이 원하는 목표에 가까워지도록 합니다. 검증 손실(Validation loss)은 검증 데이터에서 모델이 얼마나 잘 학습했는지를 측정합니다. 일반적으로 검증 손실이 낮을수록 좋지만, 모델이 일반화 가능한 패턴을 학습하는 대신 학습 데이터를 암기하는 과적합을 발견하는 데에도 도움이 됩니다.
딥러닝은 여러 층의 신경망을 사용하는 모델을 의미하며, 신경망은 이러한 모델의 기반이 되는 더 넓은 계산 구조를 가리킵니다. 이러한 시스템은 일반적으로 더 단순한 알고리즘에 비해 많은 양의 데이터와 더 긴 학습 시간을 필요로 하므로 개발 비용이 증가합니다.
모델은 어떻게 전문화되고 더 효율적으로 변하는가?
미세 조정(Fine-tuning)을 사용하면 특정 작업이나 분야에 특화된 데이터를 이용해 기존 모델을 계속 학습시킬 수 있습니다. 전이 학습(Transfer learning)은 사전 학습된 모델을 다른 작업의 출발점으로 사용합니다. 이를 통해 새로운 작업의 데이터가 제한적인 경우 개발 시간을 줄일 수 있지만, 해당 분야에 적합한 추가 데이터가 필요하지 않게 되는 것은 아닙니다.
지식 증류(Distillation)에서는 대규모 모델이 ‘교사’ 역할을 하며, 그 출력을 이용해 대규모 모델의 동작을 모방하려는 소규모 모델을 학습시킵니다. 그 결과 모델의 크기가 작아지고 효율성이 높아질 수 있지만, 성능이 어느 정도 손실될 수 있습니다. 또한 경쟁 모델의 출력을 증류하는 것은 API나 어시스턴트의 이용 약관을 위반할 수 있다고 출처는 지적합니다.
혼합 전문가 구조(Mixture of Experts)는 네트워크를 전문화된 단위로 나누고 각 요청마다 그중 일부만 활성화합니다. 이를 통해 각 작업에 필요한 계산량을 줄이면서 대규모 모델을 구축할 수 있습니다. Mistral AI의 Mixtral은 잘 알려진 사례이며, 최신 GPT 모델도 공식적인 확인은 없지만 이러한 구조를 어떤 형태로든 사용하는 것으로 널리 여겨집니다.
확산 모델(Diffusion)은 이미지, 음악, 텍스트를 생성하는 데 사용됩니다. 데이터에 점진적으로 노이즈를 추가한 다음, 노이즈에서 데이터를 복원하도록 그 과정을 거꾸로 학습합니다. GAN은 출력을 생성하는 네트워크와 이를 평가하는 네트워크를 결합하며, 특히 딥페이크 도구와 같이 범위가 좁은 응용 분야에서 사실적인 이미지와 동영상을 제작하는 데 사용되어 왔습니다.
에이전트와 도구 연결
인공지능 에이전트는 사용자를 대신해 티켓을 예약하거나 코드를 업데이트하거나 외부 서비스와 상호작용하는 등 일련의 단계를 수행할 수 있다고 여겨진다는 점에서 기본적인 챗봇과 다릅니다. 그러나 이 용어에는 통일된 정의가 없으며, 이러한 기능을 제공하는 데 필요한 구조도 여전히 개발 중입니다.
코딩 에이전트는 코드 조각을 제안하는 데 그치지 않고 코드 작성, 테스트, 오류 수정, 전체 저장소 작업을 전문으로 합니다. 그럼에도 자료에 따르면 인간의 검토는 여전히 필요합니다. 에이전트가 제한적인 감독만으로 광범위한 작업을 수행할 수 있기 때문입니다.
API 엔드포인트는 한 프로그램이 다른 프로그램에 서비스를 요청할 수 있게 해주는 백엔드 버튼과 비슷합니다. 에이전트의 능력이 향상되면서 에이전트는 이러한 엔드포인트를 발견하고 이를 사용해 자동화된 작업을 수행할 수 있습니다. 이는 실용적인 가능성을 열어 주지만 예상하지 못한 동작을 일으킬 수도 있습니다. Model Context Protocol (MCP)은 모델이 각 연결마다 맞춤형 커넥터를 구축하지 않고도 파일, 데이터베이스, 애플리케이션에 연결할 수 있게 하는 개방형 표준입니다. Anthropic은 2024년에 이 프로토콜을 제시했고, 이후 Linux Foundation으로 이전했으며, 나중에 OpenAI와 Google, Microsoft가 이를 채택했습니다.
이러한 용어에서 실질적으로 중요한 것은 무엇인가?
이러한 개념은 인공지능 시스템의 성능이 모델에만 달려 있지 않다는 점을 보여 줍니다. 병렬 처리는 GPU에서 수천 개의 작업을 동시에 실행할 수 있게 하며, 토큰 처리량(Token throughput)은 시스템이 일정 시간 동안 수행할 수 있는 작업량을 측정합니다. 이는 서비스를 제공할 수 있는 사용자 수와 응답 속도에 영향을 미치는 요소입니다.
토큰(Token)은 텍스트의 작은 단위로, 단어의 일부일 수 있으며, 언어 입력과 처리 및 모델 서비스 요금 책정에 사용됩니다. 메모리 캐싱, 특히 KV 캐싱은 추론 중 반복되는 계산을 줄이고 응답 속도를 높이는 데 도움이 됩니다.
반면 환각은 여전히 가장 큰 품질 문제 중 하나입니다. 모델은 건강 관련 답변을 포함해 부정확한 정보나 오해를 불러일으키는 조언을 생성할 수 있으며, 이러한 답변은 위험할 수 있습니다. 출처는 이 위험이 학습 데이터의 공백과 관련되어 있으며, 이것이 더욱 전문화되고 특정 분야에 맞춰진 모델을 추진하는 이유 중 하나라고 지적합니다.
특히 주목할 만한 용어로 불투명 추론이 있습니다. 이는 이해 가능한 언어로 연속적인 사고 단계를 보여 주는 대신, 요청을 모델의 여러 층을 거쳐 반복적으로 전달하는 것을 의미합니다. 이 방식은 더 효율적일 수 있으며 더 적은 계산으로 소규모 모델이 더 뛰어난 성능을 내도록 할 수 있습니다. 그러나 읽을 수 있는 흔적이 적게 남기 때문에 연구자들이 바람직하지 않은 동작을 발견하기 어려워집니다. 이와 관련된 용어인 반복 깊이(Recurrent depth)는 대체로 동일한 공학적 방식을 설명합니다.
한편 ‘Neuralese’는 모델이 이해 가능한 인간 언어 없이 내부의 디지털 표현만으로 완전히 사고하는 가상의 시나리오입니다. 출처는 실제로 공개된 어떤 모델도 이 상태에 도달하지 않았다고 설명합니다. 또한 OpenAI는 2026년 9월에 출시한 Astra 모델이 사고 연쇄의 가독성을 유지한다고 밝혔지만, 안전 연구자들은 이 모델이 불투명 추론에 사용될 수 있다는 점을 우려하고 있습니다.
이 사전의 가치는 대중적 논의에서 자주 뒤섞이는 개념들을 구분한다는 데 있습니다. 훈련은 추론이 아니며, 에이전트는 단순한 챗봇이 아니고, ‘오픈 소스’라고 해서 반드시 모델의 모든 구성 요소가 동일한 방식으로 공개되어 있다는 뜻은 아닙니다. 또한 특히 자율성과 투명성에 관련된 최신 용어들은 여전히 서로 다른 정의와 감독 및 안전의 한계에 관한 미해결 질문을 안고 있습니다.