KAIST 연구팀이 에이전트 작업의 전력 소비를 실측했다. 챗봇 대비 최대 136배.

이 숫자는 단순한 에너지 통계가 아니다. 에이전트를 운영하는 순간 비용 구조가 근본적으로 달라진다는 신호다.


왜 에이전트는 이렇게 비싼가

챗봇과 에이전트의 차이는 “몇 번 추론하는가”다.

챗봇은 질문 하나에 응답 하나를 내놓는다. 에이전트는 다르다. 목표를 받으면 계획을 세우고, 도구를 호출하고, 결과를 검증하고, 다시 판단한다. 루프를 돈다. 그 루프 안의 각 단계가 전부 모델 추론이고, 전부 비용이다.

문제는 지금 많은 팀이 루프 전체에 동일한 프론티어 모델을 사용한다는 점이다. Claude Sonnet 5나 GPT-5.5를 단순 반복 검증 작업에도, 계획 수립에도, 최종 정리에도 그대로 쓴다. 기능상 문제는 없다. 비용이 문제다.

루프가 깊어질수록, 재시도가 많을수록 비용은 선형이 아닌 지수에 가깝게 올라간다. 136배는 최악의 케이스이지만, 3배에서 10배는 설계가 나쁜 프로덕션 에이전트에서 흔히 나오는 수치다.


라우팅 질문이 바뀌었다

2년 전 모델 라우팅의 질문은 이랬다.

“어느 모델이 가장 잘 하는가?”

지금은 이 질문이 구식이다. 프론티어 모델들 사이의 성능 격차가 많은 작업에서 사실상 좁혀졌다. Sonnet과 Flash의 차이, GPT-5.5와 GPT-5.5-mini의 차이가 무의미한 태스크가 생각보다 많다.

성능 격차가 좁아지는 순간, 라우팅의 기준이 이동한다.

“이 작업에 충분한 최소 모델은 무엇인가?”

이건 미묘한 차이처럼 보이지만, 실제로는 비용 구조를 완전히 뒤집는 질문이다. “가장 잘 하는 모델”을 찾을 때는 항상 비싼 쪽으로 수렴한다. “충분한 최소 모델”을 찾을 때는 아래로 수렴한다.

emollick이 정리한 계층 위계가 현재 실전 라우팅의 기본 패턴이다. 복잡한 판단은 오케스트레이터(고가 모델), 반복 실행은 워커(저비용 모델). 분류기(classifier)가 작업이 들어오면 먼저 “이 작업은 몇 단계 추론이 필요한가”를 판단하고, 경로를 정한다.


실전 라우팅 3원칙

100 Agents를 운영하면서 정리한 원칙이다.

1. 분류기를 루프 앞에 세운다

작업이 들어올 때 즉시 고가 모델로 넘기지 않는다. 경량 모델이 먼저 작업의 복잡도를 판단한다. 단순 조회인지, 다단계 추론이 필요한지, 외부 도구 호출이 몇 번 필요한지. 이 분류 결과에 따라 라우팅 경로가 달라진다.

[작업 입력]

[경량 분류기] → 단순 작업 → Flash / Haiku 계층

           복잡 작업 → Sonnet / GPT-5.5 계층

           최고 판단 → Opus / o3 계층

2. 루프 종료 조건을 미리 설계한다

에이전트가 루프를 도는 최대 횟수, 신뢰도 임계값, 강제 종료 트리거를 초기 설계 단계에서 정한다. 이걸 나중에 추가하려 하면 이미 루프 구조가 굳어 있어 수정 비용이 크다.

종료 조건이 없는 에이전트는 정답을 찾을 때까지 무한정 돈다. 프로덕션에서 비용 폭증의 가장 흔한 원인이 이것이다.

3. 프롬프트 캐싱을 기본값으로 깐다

동일한 시스템 프롬프트가 반복되는 에이전트 패턴에서 프롬프트 캐싱은 즉시 적용 가능한 비용 절감 수단이다. Anthropic 기준으로 캐시 히트 시 토큰 비용이 약 90% 감소한다. 컨텍스트가 긴 에이전트일수록 효과가 크다.


비용이 곧 제품 결정이 된다

에이전트 비용 구조를 제대로 설계하지 않으면 생기는 문제는 두 가지다.

첫째, 수익성이 나오지 않는다. 사용자가 늘수록 오히려 손해가 커지는 구조가 된다. 특히 성과 기반 과금(outcome-based pricing)을 목표로 하는 에이전트 제품은 단위당 원가가 설계 전부터 잡혀야 한다.

둘째, 기능을 줄여야 하는 상황이 생긴다. 루프를 돌릴수록 정확도가 올라가는 에이전트에서 “비용 때문에 루프를 2회로 제한”하는 결정은 사실상 제품 품질 결정이다. 비용 제약이 기능 제약이 된다.

KAIST 데이터가 말하는 건 간단하다. 에이전트 시대의 PM은 기능 명세를 작성하는 동시에 루프 비용 구조를 설계해야 한다. 라우팅은 엔지니어링 옵션이 아니라 제품 전략의 일부다.


당신이 지금 돌리는 에이전트에서 가장 비용이 많이 나오는 단계는 어디인가요?

#AI #에이전트 #100Agents