Mallika Rao는 현대 추천 시스템에서 가장 어려운 과제가 랭킹 모델을 선택하거나 임베딩 계층을 구축하는 데 있는 것이 아니라, 실제 운영상의 제약 속에서도 성능을 유지하면서 지속적으로 학습하고 적응할 수 있는 운영 시스템을 만드는 데 있다고 본다. 이는 InfoQ가 QCon AI 자료의 일부로 게재한 Adaptive Recommenders in the Real World: Inference, Evals, and System Design이라는 제목의 발표에서 제시되었다.
Rao에 따르면 추천 시스템에 대한 논의는 대체로 후보 생성, 검색, 랭킹, 데이터 저장소, 오프라인 지표, 그리고 경우에 따라 대규모 언어 모델과 같은 익숙한 단계에 집중된다. 그러나 이러한 요소만으로는 사용자 선호도와 데이터 및 운영상의 제약이 변화하는 운영 환경에서 시스템이 지속적인 가치를 제공할 수 있는 능력을 설명할 수 없다.
개별 모델보다 중요한 전체 시스템
제시된 관점은 추론, 데이터 업데이트, 실험, 측정, 성능 모니터링을 지속적인 루프로 연결하는 통합 시스템 구축에 초점을 맞춘다. 적응형 추천에는 사용자 신호를 신속하게 수신한 뒤 이를 검색 및 랭킹 단계에 반영하는 과정이 필요하며, 이를 통해 추천 콘텐츠가 현재 상황과 동떨어지지 않도록 해야 한다.
이 자료는 검색 결과의 최신성이 모델 품질만큼이나 중요한 실무적 요소라고 지적한다. 데이터 업데이트가 지연되거나 노출 결과가 오래된 신호를 기반으로 유지된다면, 이전 테스트에서 모델 자체가 높은 정확도를 보였더라도 시스템은 변화하는 행동을 따라가는 능력을 잃을 수 있다.
속도와 비용 및 투명성 사이의 절충
이러한 시스템은 제한된 응답 시간 예산 안에서 작동하므로 여러 단계를 독립적인 구성 요소로 다루기보다 이들 사이를 정밀하게 조정해야 한다. 각 추가 계층은 결과 품질을 높일 수 있지만, 동시에 응답 시간과 운영 비용 및 장애 진단의 복잡성을 증가시킬 수 있다.
따라서 Rao는 정확도와 더불어 관측 가능성, 실험 가능성, 신뢰, 규정 준수를 핵심 설계 요건으로 둔다. 이러한 요건은 팀이 운영 루프 내부에서 일어나는 일을 이해하고, 변경 사항의 영향을 측정하며, 특정 지표에서 나타난 개선이 실제로 제품에 반영되는지 판단하는 데 도움을 준다.
이 소식이 중요한 이유는 무엇인가?
이 관점의 실질적인 가치는 추천 시스템 평가를 “어떤 모델이 더 나은가?”라는 질문에서 더 광범위한 질문으로 전환한다는 데 있다. 즉, 전체 시스템이 신속하게 학습하고, 명확한 시간 및 비용 한도 안에서 작동하며, 성능이 저하되거나 향상된 이유를 보여줄 수 있는가를 묻는 것이다. 검색이나 개인화 또는 콘텐츠 발견 기능을 구축하는 팀에게 이는 운영 인프라와 지속적인 평가에 대한 투자가 모델에 대한 투자만큼이나 결정적일 수 있음을 의미한다.
출처는 구체적인 실행 방법이나 수치 비교 결과를 제시하지 않는다. 대신 Twitter와 Walmart 및 Netflix에서 Rao가 쌓은 검색과 추천 및 개인화 인프라 경험에 기반한 일반적인 엔지니어링 프레임워크를 제시한다. 따라서 지표를 선택하는 방법, 피드백 루프를 설계하는 방법, 신뢰 및 규정 준수 요건의 균형을 각 제품에 맞게 조정하는 방법은 여전히 각 환경에 맞는 별도의 처리가 필요한 열린 질문으로 남아 있다.
뉴스 출처
InfoQ - Architecture Articles
원문 보기 ↗