최근 전혀 다른 세 곳에서 같은 결론이 나왔습니다.

ServiceNow는 자사의 Context Engine을 “사이드카 방식 탈피, 기업 맥락 기반 AI 네이티브 전환”이라 정의했습니다. MCP context-mode 오픈소스는 컨텍스트를 98% 감축하는 기법을 상용 단계로 끌어올렸습니다. 그리고 안드레 카파시가 공개한 70줄짜리 CLAUDE.md는 GitHub 주간 트렌딩 1위를 28일 연속 지켰습니다. 세 신호가 가리키는 방향은 같습니다. 에이전트 경쟁의 다음 축은 모델 성능이 아니라 컨텍스트 설계입니다.


왜 지금 컨텍스트인가

에이전트 오케스트레이션을 논할 때 많은 팀이 첫 번째로 보는 것은 “어떤 모델을 쓸 것인가”입니다. GPT-5 vs Claude Opus 4.8 vs Gemini — 벤치마크 비교가 기획서 첫 페이지를 채웁니다.

하지만 프로덕션 에이전트의 실패를 분석하면 패턴이 다릅니다. 모델이 틀린 게 아닙니다. 모델이 필요한 정보를 받지 못한 겁니다.

Grok이 4개 특화 에이전트를 병렬로 검증하는 구조로 환각률을 65% 줄인 것도 같은 원리입니다. 에이전트마다 맥락의 범위를 다르게 가져가고, 서로 교차 검증하는 방식입니다. 더 똑똑한 모델이 아니라, 더 잘 나눈 컨텍스트가 품질을 결정했습니다.


컨텍스트 설계가 오케스트레이션을 결정한다

ServiceNow의 Context Engine은 단순한 RAG 업그레이드가 아닙니다. “사이드카”를 붙이던 방식, 즉 기존 시스템 옆에 AI를 끼워 넣는 방식을 버린 겁니다. 기업의 데이터, 프로세스, 정책이 에이전트가 살아가는 환경 자체가 됩니다. 컨텍스트가 시스템의 일부가 아니라 시스템 그 자체입니다.

CLAUDE.md가 11만 스타를 받은 이유도 같은 맥락입니다. 파일의 내용은 화려하지 않습니다. “이런 코딩 스타일을 써라”, “이 디렉토리 구조를 지켜라”, “이 방식으로 커밋해라” 같은 지침입니다. 하지만 이 70줄이 모델 자체보다 더 직접적으로 에이전트 행동을 제어합니다. 개발자들이 스타를 누른 건 새로운 기능이 아니라, 컨텍스트가 모델을 이긴다는 경험적 증거였기 때문입니다.

MCP context-mode의 98% 감축도 같은 통찰에서 나옵니다. 에이전트에게 무조건 많은 정보를 넣는 게 아니라, 지금 이 작업에 필요한 맥락만 정밀하게 선별해서 넣는 방식입니다. 토큰 비용이 줄고, 판단 품질이 올라갑니다.


PM이 설계해야 할 세 가지 질문

모델을 고르는 것은 팀에서 가장 쉬운 결정입니다. 문서화가 잘 된 API가 있고, 벤치마크 비교 표가 있고, 가격 계산기가 있습니다.

어려운 결정은 에이전트가 어떤 컨텍스트를 갖고 판단해야 하는가입니다.

첫째, 이 에이전트의 판단 범위는 어디까지인가. 고객 서비스 에이전트가 결제 취소를 직접 처리해도 되는가, 아니면 상담사에게 넘겨야 하는가. 이 경계가 컨텍스트 설계의 출발입니다. 경계가 명확하지 않으면 모델이 아무리 강해도 엉뚱한 판단을 합니다. 범위가 설계입니다.

둘째, 지금 이 순간 필요한 정보는 무엇인가. 에이전트에게 전체 고객 데이터베이스를 넘기는 팀이 있습니다. 98%의 토큰을 낭비하는 이유는 그 중 실제로 판단에 쓰이는 정보가 2%이기 때문입니다. 컨텍스트 윈도우는 비쌉니다. 선별이 설계입니다.

셋째, 판단의 근거를 기록하는가. 에이전트 관찰성(observability) 도구가 빠르게 성장하는 이유가 있습니다. 에이전트가 무엇을 보고 결정했는지 추적하지 않으면, 오류가 났을 때 디버깅이 불가능합니다. 컨텍스트는 입력이기도 하고, 감사 레코드이기도 합니다.


오케스트레이션의 진짜 경쟁

Anthropic이 Opus 4.8에서 Dynamic Workflows를 꺼낸 건 의미 있는 신호입니다. 에이전트가 서브에이전트를 오케스트레이션하는 스크립트를 직접 작성하고, 총 1,000개까지 동시 실행합니다. 이 기능이 주목받는 이유는 모델 성능 때문이 아닙니다. 에이전트 자신이 컨텍스트 분배를 설계하기 때문입니다. 어떤 서브에이전트에게 어떤 정보를 넘길지를 에이전트가 런타임에서 결정합니다. 컨텍스트 설계가 코드 레이어로 내려온 겁니다.

한국 팀들이 에이전트를 도입할 때 가장 많이 막히는 지점은 “어떤 모델이 나은가”가 아닙니다. 실제로는 “이 에이전트가 지금 무엇을 알아야 하는가”에서 멈춥니다. ServiceNow도, Grok도, 카파시의 CLAUDE.md도, 모두 같은 문제를 먼저 풀었습니다.

컨텍스트가 오케스트레이션을 결정합니다. 모델 선택은 그 다음입니다.

당신의 에이전트는 지금 어디서 컨텍스트를 받고 있나요?