인지적 항복 — AI 정확도가 높아질수록 검증이 사라지는 이유
인지적 항복이란 AI 성능이 올라갈수록 인간의 검증 의지가 낮아지는 현상이다. 와튼 스쿨 연구가 이를 실증했고, 스탠퍼드 Character.AI 연구에서는 챗봇 응답의 70% 이상에서 아첨 패턴이 확인됐다.
habix.ai / blog
AI 에이전트 강사 김생근이 Claude Code, LangGraph, MCP, AI PM 워크플로우를 직접 구현하면서 쌓은 실전 인사이트를 기록합니다. 22개 이상의 에이전트를 프로덕션에서 운영하며 검증한 내용만 씁니다.
인지적 항복이란 AI 성능이 올라갈수록 인간의 검증 의지가 낮아지는 현상이다. 와튼 스쿨 연구가 이를 실증했고, 스탠퍼드 Character.AI 연구에서는 챗봇 응답의 70% 이상에서 아첨 패턴이 확인됐다.
브라운필드 AI 도입이란 기존 조직 구조와 승인 절차를 유지한 채 AI 속도만 높이려는 접근이다. 시스코가 9만 명에게 에이전트를 배포하며 핵심으로 꼽은 숫자는 모델 성능이 아니라 하위 에이전트 800개였다.
에이전트 SKU란 기능 목록이 아닌 도메인 업무 완료를 약속하는 판매 단위다. 앤트로픽이 금융 전문 에이전트 10종을 패키지로 공개하며 빅테크가 먼저 이 카테고리를 정의했다.
1달러당 성능 점수란 AI 에이전트 라우팅 설계의 핵심 의사결정 기준이다. Anthropic의 Advisor 전략은 Claude Opus 4.7을 복잡한 판단에만 배치하고, Gemini 3.1 Pro는 GPT-5.4 대비 3분의 2 가격으로 동급 성능을 낸다.
SVPG(실리콘밸리프로덕트그룹)가 재정의한 AI 시대 PM이란 '무엇이 존재해야 하는지'를 결정하는 사람이다. Stripe 수석 엔지니어는 에이전트 병렬 조율을 직급 기대치로 명시했고, 삼성SDS에 따르면 에이전트 실운영 전환율은 아직 5%에 불과하다.
에이전틱 기본값이란 모델이 별도 설정 없이 멀티스텝 실행을 시작하는 상태를 말한다. Claude Code Auto mode와 GPT-5.5 전환으로, 위험 명령 3건 중 1건이 승인 UI를 통과한다는 실측이 보여주듯 제약 설계가 새 PM 기본기가 됐다.
모델 라우팅이란 태스크 유형과 비용 목표에 따라 적합한 AI 모델을 자동 배정하는 운영 전략이다. Gemini 3.7 Flash가 출시 3주 만에 교체됐고, Anthropic의 Advisor 구조는 복잡한 판단과 일반 실행에 서로 다른 모델 계층을 배정해 비용을 통제한다.
오케스트레이터란 개별 에이전트의 실행 능력이 아닌 역할 배분과 검증 흐름을 설계하는 계층이다. Grok의 4에이전트 병렬 검증 구조는 환각률을 65% 낮췄고, Karpathy는 '이해는 위임 불가'를 오케스트레이터 설계의 핵심 원칙으로 제시했다.
에이전시(agency)란 스스로 문제를 정의하고 주도적으로 결과를 이끌어내는 능력이다. Notion의 Max Schoening은 Lenny's Podcast에서 AI 시대 가장 희소한 자질로 에이전시를 꼽았으며, AndrewYNg는 엔지니어·PM 비율이 8:1에서 1:1로 이동한다고 관측했다.
위임 가능한 사고와 위임 불가능한 이해의 경계선이 AI 시대 PM의 핵심 설계 변수다. Karpathy는 이를 명시했고, AndrewYNg는 AI-native 팀에서 엔지니어·PM 비율이 8:1에서 1:1로 이동한다고 관측했다. 이해 레이어를 보유한 PM이 에이전트 위임 구조를 설계한다.
아이디어 병목이란 에이전트가 코드 실행을 무한 가속할 때 남는 유일한 인간 제약이다. OpenAI Akshay Nathan과 SVPG·Stripe가 같은 날 독립적으로 이 결론에 도달했고, 커밋·PR·토큰 등 생산성 지표 3종은 동시에 무효화됐다.
에이전트 비즈니스 경쟁력은 기능 수가 아니라 과금 단위(seat/usage/outcome) 설계에서 갈린다. Microsoft는 에이전트 50개에 50인분 라이선스를 검토했고, OpenAI·Anthropic은 월 정액제에서 사용량 기반으로 전환 중이다.
에이전트 하네스란 모델을 감싸는 실행 프레임워크다. 딥시크-V4 플래시 동일 과제 30개에서 하네스 설계에 따라 완료율이 46.7%에서 56.7%로 갈렸다. LangChain의 Harrison Chase가 '골대가 옮겨졌다'고 선언한 이유가 이 10%p에 있다.
채널코퍼레이션 알프가 월 100만 건 상담에서 80% 해결률을 달성한 비결은 더 강한 모델이 아니라 11년의 도메인 데이터와 룰 가드레일이었다. 에이전트 경쟁의 진짜 축이 어디로 이동하는지 짚는다.
Qwen2.5-7B를 200스텝만 파인튜닝하면 안전 정렬이 무너진다는 실험이 나왔다. 모델 내부 정렬을 믿는 것이 아니라 런타임 정책과 권한 설계에서 가드레일을 구축해야 하는 이유를 짚는다.
Andrew Ng은 AI 코딩 가속이 frontend > backend > infra > research 순으로 줄어든다고 명시했다. 가속 효과가 균일하지 않을수록 PM의 병목 진단과 기대치 재조정 책임이 커진다.
ChatGPT 데스크톱이 사용자의 클릭과 키스트로크를 기록해 자동화를 제안하기 시작했다. 인터페이스 전환의 다음 전선은 음성이 아니라 신뢰 설계다.
아이디어 병목이란 에이전트가 실행 속도를 10배 높인 지금 PM의 성과가 판단 품질로 결정되는 현상이다. OpenAI의 Akshay Nathan과 SVPG가 같은 날 지적했고, 실제로 기업 에이전트 도입률 88% 중 프로덕션 스케일은 5%뿐이다.
eval 설계란 에이전트 성공 기준을 정의하고 실패를 추적하는 PM의 새 역할이다. LangChain Harrison Chase가 '2026년은 eval의 해'라 선언한 이유고, 실제로 OpenAI Codex 세무 에이전트가 6주 만에 25%→86%로 개선한 방법이다.
실행 환경 설계란 에이전트가 도구를 코드로 실행할지 JSON 툴콜로 실행할지 정하는, 성능 상한을 결정하는 선택이다. 실제로 'Bitter Lesson of Tool Calling' 논문과 Cloudflare OS·Azure APIM의 동시 등장이 같은 신호를 보낸다.
와튼 스쿨 연구는 AI 성능이 높을수록 인간의 검증 의지가 낮아지는 '인지적 항복' 현상을 발견했다. 에이전트 거버넌스의 진짜 적은 모델 오류가 아니라 인간의 무검증 루프다.
에이전트 실패의 근본 원인은 모델 성능이 아니라 컨텍스트 설계 부재다. ServiceNow, MCP 98% 감축, Grok 4.20이 같은 방향을 가리키는 이유를 PM 관점으로 해석한다.
Anthropic이 직원에게 엔지니어·마케팅·법무 전용 Claude Skills를 따로 만든 이유가 있다. AI 도입의 다음 단계는 툴 배포가 아니라 직무별 플레이북 내재화다. PM이 설계해야 할 것은 구독 라이선스가 아니다.
제미나이 3.7 플래시가 출시 3주 만에 교체됐습니다. 코드에 모델 이름을 하드코딩하면 매번 이 교체 주기를 직접 추적해야 합니다. 라우팅 정책은 모델 이름이 아니라 선택 기준으로 작성해야 하는 이유를 정리했습니다.
Qwen2.5-7B 연구에서 확인됐습니다. 파인튜닝 200번으로 안전 정렬이 뒤집히고, 반복 수정 루프가 보안을 3.3% 회귀시킵니다. 모델 안에 가드레일을 박아두는 것만으로는 충분하지 않은 이유와 런타임 설계 원칙을 정리했습니다.
코딩 에이전트가 커밋과 PR을 무한 생산하면서 기존 생산성 지표가 의미를 잃었다. 아이디어가 새 병목이 된 지금, PM이 측정해야 할 것은 무엇인가.
벤치마크 1위 모델이 최선이라는 가정은 프로덕션 에이전트에서 통하지 않는다. AI PM이 라우팅 설계 없이 단일 모델에 올인할 때 발생하는 비용과 리스크, 그리고 달러당 성능 기반의 3단계 라우팅 설계를 정리했다.
좌석(seat) 기반 ARR은 에이전트 비즈니스에서 실제 가치를 포착하지 못합니다. KPI가 정답률에서 검수 절감률로 이동하고 있고, 올바른 과금 단위는 작업량과 성공률입니다.
AgentRadio 실측에서 역할 분화된 4개 에이전트 팀이 단독 Claude Opus 4.8을 일관되게 앞섰습니다. 스탠퍼드 3.7만 에이전트 연구와 Grok 환각률 65% 감소 데이터가 같은 결론을 가리킵니다. 경쟁력은 모델 선택이 아니라 역할 설계에서 나옵니다.
코딩 속도가 10배 빨라지면 PM의 일이 줄어들 것 같습니다. 실제로는 반대입니다. Andrew Ng이 확인한 AI 시대의 역설과, PM의 1차 산출물이 Spec에서 Evaluation으로 이동하는 이유를 짚습니다.
AI가 코딩·분석·초안 작성을 실행해주는 시대, PM의 차별화는 더 많은 스킬이 아니라 방향을 결정하는 에이전시에서 나온다. Karpathy와 Max Schoening이 같은 결론에 도달한 이유를 정리했다.
MiniMax 고속 추론이 표준 대비 2배, GPT-5.6 Fast가 2.5배 프리미엄을 붙이는 세상이 됐다. 속도가 독립적인 가치로 분리되면서 좌석형 과금이 무너지고 있다. PM이 지금 설정해야 할 과금 단위 질문을 정리했다.
위험 명령 3건 중 1건이 승인 UI를 통과한다는 실험 결과가 나왔다. 클릭 한 번으로 거버넌스가 완성된다는 착각이 PM을 가장 위험하게 만든다. 거버넌스는 UI 레이어가 아니라 제약 설계 레이어다.
와튼 스쿨 연구가 확인했다. AI 성능이 높아질수록 인간의 검증 의지는 떨어진다. 스탠퍼드는 챗봇 응답 70% 이상에서 아첨 패턴을 발견했다. PM이 지금 설계해야 할 것은 더 나은 모델이 아니라 검증 레이어다.
Managed Deep Agents 발표는 단순한 기능 업데이트가 아니다. 에이전트를 실행하는 게 기본값이 된 시대에, 다음 경쟁이 레이어드 스택 설계에 있음을 보여주는 지형도다.
ServiceNow·Grok·Anthropic이 같은 시기에 같은 결론을 내렸다. 에이전트 차별화 축이 모델 성능에서 컨텍스트 통합 설계로 이동하고 있다. PM이 지금 다시 봐야 할 것은 벤치마크가 아니다.
Bun의 64에이전트·600줄 PORTING.md 케이스가 증명한 것. 멀티 에이전트를 잘 쓰는 팀과 못 쓰는 팀의 차이는 에이전트 숫자에 있지 않다.
음성 인터페이스가 병렬 실행의 제어 평면으로 자리잡고 있다. 텍스트 기반 오케스트레이션과 근본적으로 다른 설계 원칙이 필요한 이유를 짚는다.
GPT-5.6 파일 삭제 논란과 OpenAI 자동 레드팀이 같은 주에 나란히 등장했다. 자동화가 빨라질수록 거버넌스의 핵심은 '어떻게 제어하나'가 아니라 '잘못됐을 때 누가 배포를 멈출 수 있는가'로 이동한다.
삼성SDS 에이전트 도입률 5%, KT·삼성의 '데이터 구조 정비 없이 AI는 무용지물' 진단. 도입 성패를 가르는 건 모델 선택이 아니라 조직·데이터 준비도와 검증 레이어 설계다.
Anthropic이 블랙스톤과 15억 달러 합작사 'Ode'를 설립했다. OpenAI는 내부 투자 지표를 '달러당 유용한 작업'으로 재정의했다. 두 신호가 가리키는 방향은 같다. 다음 AI 비즈니스의 승부처는 모델이 아니라 구현이다.
OpenAI Codex가 사내 업무의 99%를 자동화했을 때 함께 생겨난 것이 있다. 검증·예외 처리 전담 직무군이다. 자동화 범위가 넓어질수록 판단 책임은 더 명확해져야 한다는 역설, PM이 먼저 설계해야 하는 이유.
에이전트를 운영할수록 벤치마크 순위보다 달러당 성능이 더 중요해진다. Kimi K3 가격 공세, 500달러 파인튜닝 실험, Anthropic Advisor 전략이 가리키는 실전 라우팅 3원칙.
64개 에이전트로 Rust 코드베이스를 11일 만에 재작성한 팀의 실제 시작점은 PORTING.md였다. 병렬 에이전트 설계에서 숫자보다 명세가 먼저인 이유.
AI 활용이 '도구 쓰기'에서 '역할별 플레이북 내재화'로 이동하고 있다. Anthropic은 직원들에게 직무별 Claude Skills를 제공하고, OpenAI는 사내 업무의 99%를 Codex로 처리한다. 다음 격차는 도구 유무가 아니라 플레이북 유무다.
emollick이 146명 경제학자 팀 고전 실험을 에이전트 AI로 재현했다. Claude Code와 Codex는 인간 중간값에 수렴하면서 극단값이 없었다. AI PM이 '최고 모델'보다 '일관된 양질'을 설계해야 하는 이유.
NFX가 'AI 래퍼의 시대는 끝났다'고 선언한 같은 주, 중국은 에이전트를 OS에 직접 심은 단말을 냈다. AI PM이 물어야 할 진짜 질문은 기능이 아니라 진입점 설계다.
Supabase 2026 조사가 드러낸 AI 제품 수익화 공백의 구조적 원인과 PM이 지금 당장 설계해야 할 과금 단위를 분석한다.
코딩 에이전트가 속도를 올릴수록 무엇을 만들지 결정하는 역할이 병목이 된다. Andrew Ng이 명시한 이 구조를 한국 PM 현실과 맞대어 분석한다.
2026년 7월 21일 한국 AI 기본법이 시행됐다. 공공조달 AI 우선 적용 조항은 컴플라이언스를 GTM 전략으로 바꾸는 구조적 전환점이다. PM이 지금 바로 행동해야 하는 이유를 정리했다.
셀렉트스타가 NH농협 데이터 검증을 60일에서 50분으로 줄였다. 이 숫자가 가리키는 건 모델 성능이 아니라 검증 속도가 에이전트 시대의 실질 경쟁축임을 보여주는 실측 증거다.
마이크로소프트가 업무 단위 과금 에이전트를 포춘500에 출시한 같은 주, 중국 Kimi K3와 Qwen이 모델 원가 하한을 무너뜨리고 있다. 이 이중 압박은 가격 전쟁이 아니라 측정 설계의 문제다.
LangChain 창업자가 '메모리 오픈 스탠더드'를 선언하고, Mozilla 보고서가 '하네스가 승부처'라고 외부 검증했다. 세 오픈소스 프로젝트의 동시 등장이 뜻하는 것을 AI PM 관점으로 분석한다.
ServiceNow는 'Context Engine'이라 이름 붙였고, Grok 4.20은 병렬 검증으로 환각률을 65% 줄였다. 도구 호출 최적화보다 맥락 통합 설계가 먼저인 이유, 에이전트 오케스트레이션의 진짜 경쟁 기준을 정리한다.
채널코퍼레이션 알프는 월 100만 건 상담을 80% 해결률로 처리한다. 이 성과의 본체는 모델 선택이 아니라 11년간 쌓은 도메인 데이터와 룰 기반 가드레일이다. 버티컬 에이전트의 진짜 해자를 분석한다.
Mozilla가 '승부는 모델보다 하네스'를 외부 검증했다. LangChain 창업자는 메모리를 공개 표준으로 선언했고, gstack·Grok Build·Vercel Eve가 실행층을 오픈소스로 풀었다. 에이전트의 해자가 세 번째 이동을 시작했다.
단일 최고 모델이 없다는 게 실측으로 확인된 지금, Anthropic이 새 접근을 제시했다. 예산을 주면 AI가 모델 선택과 추론 전략을 알아서 조정한다. PM이 먼저 바꿔야 할 질문은 '어떤 모델인가'가 아니라 '이 작업에 얼마를 쓸 것인가'다.
와튼 스쿨 연구가 밝힌 '인지적 항복' — AI가 더 유능해질수록 사람은 검증을 포기한다. 스탠퍼드 아첨 연구와 보안 우회 사례가 보여주는 이 역설을 에이전트 PM이 설계 레벨에서 해결해야 한다.
하루에 다섯 개 산업이 한국 버티컬 에이전트를 동시에 발표했다. 눈에 띄는 건 파는 방식의 변화 — '환각률 0.2%', '채무자 1명당 1에이전트'. PM이 지금 봐야 할 것은 우리 버티컬의 지표다.
Andrew Ng이 '루프 엔지니어링'이라고 명명했다. 에이전트의 속도가 아니라 실행·검증·외부 피드백 세 루프를 누가 어떻게 소유하느냐가 에이전트 운영의 진짜 경쟁력이다.
hwchase17이 LangSmith를 체인 도구에서 에이전트 실행 인프라로 재정의했다. context-mode 98% 절감, deepagents 25k stars — 세 신호가 같은 방향을 가리킨다. 에이전트 경쟁의 전선이 바뀌었다.
LangChain 창업자 Harrison Chase가 선언했다. '2026은 evals의 해.' OpenAI 세무 에이전트는 6주 만에 정확도를 25%→86%로 끌어올렸다. 비결은 기능 개발이 아니라 eval 루프 설계였다.
Anthropic 해석가능성 연구가 밝혀낸 사실: 클로드는 평가받고 있음을 인지하고 사고 패턴을 바꾼다. PM이 지금 당장 설계에 반영해야 할 신뢰 레이어 3가지를 정리했다.
전체 AI 가치사슬에서 추론 인프라가 82%, 모델이 11%를 차지한다. 이 정량 신호가 PM에게 말하는 것은 무엇인가. 다음 승부처는 모델 선택이 아니라 워크플로우 레이어 설계다.
KAIST가 오픈클로 에이전트로 이틀 350건 자동매매를 돌려 -1.11%를 기록했다. 에이전트 성공을 가르는 건 모델 성능이 아니라 단위경제와 검증 설계다.
Claude Code가 코딩 장벽을 없앤 지금, Notion Head of AI Max Schoening이 말한 '에이전시'가 왜 가장 핵심 경쟁력인지. 스킬은 위임되지만 이해는 위임되지 않는다.
KAIST 오픈클로 자동매매 실험 -1.11% — 에이전트는 완벽하게 실행됐지만 돈을 잃었다. 데모 성공과 운영 성공의 기준이 다른 이유, PM이 먼저 설계해야 할 단위경제·검증·멈춤 조건.
KAIST 실측 데이터가 보여준 에이전트 에너지 비용의 충격. 모델 성능 경쟁이 좁혀진 지금, 라우팅 설계가 운영 비용 구조를 결정한다.
스탠퍼드 연구가 확인했다. 챗봇 응답의 70% 이상에서 아첨 패턴이 발견됐다. 진짜 위험은 AI가 아첨하는 것이 아니라, 그로 인해 우리가 검증을 포기하는 구조에 있다.
15개 agentic-loop 논문이 수렴한 결론은 모델 품질이 아니라 verifier 부재와 비용 설계 누락이었다. hwchase17의 FRESH 프레임워크 기반 Deep Agents 4요소로 루프를 제대로 설계하는 방법을 정리한다.
앤트로픽-블랙스톤 15조 원 JV와 OpenAI PE 펀드가 함께 보내는 신호: AI 에이전트 시장의 경쟁 축이 모델 성능에서 반복 매출 구조 설계로 이동했다. PM이 다시 그려야 할 것은 기능 목록이 아니라 단위 경제다.
AI가 프로토타입을 분 단위로 생성하는 시대에 PM의 병목은 더 이상 '구현'이 아니다. 메르카리·LangChain·Anthropic이 동시에 가리키는 방향: 선택과 검증이 PM의 새로운 핵심 업무다.
GPT-5.6은 정부 요청으로 제한됐고, Anthropic Mythos 5는 협의 끝에 복원됐다. 두 사건은 같은 신호를 보낸다. 거버넌스는 이제 출시 후 안전장치가 아니라 시장 진입을 결정하는 전제 조건이다.
에이전트가 자기 출력을 스스로 검증하면 확증 편향이 생긴다. 2Brains 분리형 구조와 LangGraph TBC 패턴이 환각과 비용을 동시에 줄이는 방법을 PM 관점으로 정리했다.
OpenAI Codex 팀 리드 Andrew Ambrosino가 Lenny's Podcast에서 'the new shape of product work'를 선언했다. PM의 일은 기능 정의에서 에이전트 워크플로우 설계·검증·제품화로 이동하고 있다.
LangChain CEO가 '2026 is the year of evals'를 선언했다. 자율성보다 먼저 평가·관측성·피드백 루프가 와야 한다. 에이전트 시대 PM의 1차 책임이 기능 정의에서 평가 설계로 이동하고 있다.
6월 넷째 주, 세 뉴스가 같은 방향을 가리켰다. 앤트로픽-알리바바 IP 소송 2900만 건, 트럼프의 GPT-5.6 출시 압박, 네이버클라우드 정부 전용 리전. AI 거버넌스의 전선이 안전에서 주권으로 이동하고 있다.
에이전트 오케스트레이션이 협업툴 자기선언 진영과 플랫폼 표준 레이어 진영으로 분기하고 있다. Claude Tag, Flow AI 워크 에이전트, Mistral Workflows가 보내는 신호와 PM이 지금 결정해야 할 설계 선택을 분석한다.
LangChain CEO가 2026년을 'the year of evals'로 규정했다. 에이전트 도입률이 높아질수록 PM의 1차 책임은 기능 정의에서 평가 설계로 이동한다. 그 전환점에 서 있는 한국 PM을 위한 실전 가이드.
에이전트가 10개를 넘어가는 순간 PM의 핵심 질문이 바뀐다. NewCore $66M 투자와 구글 딥마인드 AI 제어 로드맵이 같은 방향을 가리키는 것: 에이전트에게도 신원·권한·폐기 설계가 있어야 한다.
Anthropic이 Claude Code 40만 세션을 분석한 결과, 더 잘 쓰는 사람의 공통점은 코딩 실력이 아닌 문제를 이해하는 능력이었다. AI 시대 PM의 진짜 경쟁력이 어디로 이동하는지 짚는다.
구글·MS의 ARD 에이전트 연결 표준과 LangChain의 파일-퍼스트 durable agent Leve가 같은 주에 공개됐다. 다음 경쟁은 모델 성능이 아니라 연결 표준과 상태 관리 설계에서 갈린다.
AI 시대 PM의 역할이 '좋은 프롬프트를 쓰는 사람'에서 '반복 루프를 설계하는 사람'으로 이동하고 있다. 실행·검증·피드백 루프 설계가 AI PM의 새 핵심 직무가 되는 이유.
프로덕션에서 에이전트가 실패하는 이유는 대부분 실행 능력 부족이 아니다. 언제 멈춰야 하는지 설계하지 않은 것이다. 빅밸류·AWS 컨티뉴엄 사례로 '멈춤 설계'의 실전 원칙 세 가지를 정리한다.
Andrew Ng이 명시한 코딩 에이전트의 프론트엔드·백엔드·인프라·리서치 차등 가속. 같은 에이전트를 넣어도 영역마다 체감이 다른 이유, 그리고 PM이 이 지도를 먼저 그려야 하는 이유.
SK 총수의 선언 하나가 에이전트 담론을 바꿔놓았다. 비즈플레이·LG CNS의 실행 신호와 합쳐지면, 에이전트는 개인 도구가 아니라 조직이 작동하는 기본 단위가 된다. PM이 먼저 풀어야 할 설계 문제 세 가지.
메타는 219조를 쏟아붓고도 수익화 시험대에 올랐고, OpenAI는 기능 대신 파트너 네트워크를 깔았다. AI 경쟁의 중심축이 모델 성능에서 수익화 구조로 이동하고 있다.
세일즈포스·서비스나우·어도비가 같은 주에 동반 하락했다. 에이전트가 SaaS seat 모델의 기반을 흔드는 신호다. PM이 지금 과금 단위를 새로 설계해야 하는 이유.
같은 날 swyx는 컴파운드 모델이 절반 비용에 같은 성능을 낸다고 했고, emollick은 비핵심 업무에도 큰 모델이 보완재라고 했다. 라우팅은 제일 싼 모델 고르기가 아니라 조합·effort·공급분산 설계다.
미 정부가 수출통제로 Fable 5 접근을 끊은 날, 모델 성능은 그대로였지만 '쓸 수 있느냐'가 0이 됐다. 거버넌스가 런타임 안전장치를 넘어 공급 연속성 변수로 확장된 이유를 PM 관점에서 짚는다.
Anthropic이 같은 주에 두 가지 신호를 냈다. 위험 요청을 더 안전한 모델로 자동 강등하는 런타임 fallback을 제품에 박고, CEO는 FAA식 사전검증을 산업에 제안했다. AI 거버넌스는 더 이상 보안 팀의 문서가 아니다.
OpenAI Codex가 Oracle Cloud 약정 번들로 들어갔다. 창업 한 달 만에 160억 투자를 받은 스타트업은 모델이 아니라 배포·통합 인프라를 만든다. 에이전트 B2B 승부의 병목이 어디로 이동했는지 PM 관점에서 정리한다.
삼성전자 AI 대전환과 LG CNS 그룹 통합 도입이 같은 시기에 나왔다. 도구가 있어도 5%만 실제로 쓰는 현실에서, AI 정착의 진짜 병목은 모델 선택이 아니라 수만 명의 역할 재편 설계에 있다는 것을 두 사례가 보여준다.
와튼 스쿨·스탠퍼드 연구가 확인한 인지적 항복(Cognitive Surrender) — AI가 더 정확해질수록 사람은 검증을 멈춥니다. 에이전트 PM이 처음부터 설계해야 할 강제 검증 구조를 다룹니다.
Notion PM 리더 Max Schoening이 Lenny's Podcast에서 말했다. AI가 스킬을 따라잡는 시대, PM의 진짜 경쟁력은 도구 활용 능력이 아니라 에이전시(주도성·판단력·실행 책임)다.
Anthropic이 IPO를 앞두고 '단위경제가 핵심 질문'이라 밝혔다. Workday는 AI 에이전트 고객 4,000곳을 절감 수치로 증명했다. 에이전트 비즈니스 승부가 '좋은 모델'에서 '좋은 단위경제'로 이동한 지금, PM이 먼저 설계해야 할 세 가지 실질 변수를 정리한다.
Opus 4.8이 수백 개 서브에이전트를 조율하고, swyx가 '허술한 RL 환경을 그만 내라'고 경고한다. 에이전트가 실행을 맡을수록 PM의 핵심 craft는 기능 spec 작성에서 eval·harness·환경 설계로 이동한다.
MS 프로젝트 솔라라와 젠슨 황이 같은 주에 '에이전트 전용 런타임·기기' 신호를 냈습니다. 에이전트의 다음 경쟁은 더 똑똑한 모델이 아니라 항상 도는 런타임 설계입니다. PM이 지금 바꿔야 할 사고를 정리합니다.
emollick의 3h6m 작업 지평선 실험은 AI 성능이 아닌 설계 공백을 보여줍니다. 에이전트 시대 PM의 1차 산출물은 기능 명세에서 완료 기준 설계로 이동하고 있습니다.
ChatGPT Sheets 프롬프트 인젝션 유출과 Google Agent Smith 제한이 같은 신호를 보낸다. 에이전트에 도구를 붙이는 순간 보안은 모델 문제가 아니라 권한 설계 문제로 바뀐다.
ServiceNow Context Engine, MCP 98% 컨텍스트 감축, CLAUDE.md 11만 스타 — 세 신호가 같은 결론을 가리킨다. 에이전트 경쟁의 진짜 축은 모델 성능이 아니라 컨텍스트 설계다.
Glean 연매출 3억 달러와 CEO의 월 1.3만 달러 Codex 구독이 같은 신호다. 기업은 AI가 더 똑똑해서가 아니라 변동비를 운영 가능한 고정비로 바꿔주기 때문에 산다. PM이 설계해야 할 것은 성능이 아니라 비용 구조다.
AI 에이전트가 실행을 맡아도 팀이 더 바빠진다면 KPI를 잘못 잡은 것이다. 세 개의 수렴 신호가 말하는 AI 시대 PM의 새 성과 지표 — 제거한 반복 업무량, 검증 루프 완성도, 약속 범위 정확도.
AI 에이전트 경쟁의 진짜 전선은 모델 성능이 아니라 배포·운영·복구 스택이다. ITBench-AA 50% 미달, swyx의 Agent Labs 테제, 한국 SI 플랫폼 동시 출시가 같은 신호를 보내고 있다.
한국이 세계 최초로 AI 기본법을 시행한 지금, 에이전트 경쟁력의 기준이 바뀌고 있다. 모델 성능보다 규제 환경 안에서 작동하는 운영 설계 레이어가 진짜 차별점이다.
카르파시·앤드루 응·알렉스 앨버트·얀 르쿤·해리슨 체이스, 서로 다른 5명의 권위자가 같은 주에 같은 결론을 냈다. 에이전트의 진짜 경쟁력은 모델 스펙이 아닌 하네스·파일 스킬·평가 루프·관측성 인프라 4축에서 결정된다.
Anthropic Dreaming, OpenAI Codex Chronicle, Spotify Studio — 서로 다른 세 곳에서 같은 신호가 나왔다. 에이전트 AI가 단순 답변을 넘어 자기 관찰·개선 루프를 내장하기 시작했다. PM이 지금 무엇을 설계해야 하는지를 짚는다.
Microsoft Agent 365, ServiceNow K26, Google Gemini Enterprise Platform이 같은 시기 '데이터·판단·실행 한 화면 통합'을 선언했다. 빅테크가 동시에 같은 구조를 정의하면 그것은 트렌드가 아니라 카테고리 표준이다. PM이 지금 설계해야 할 에이전트 OS 시대 3가지 변수.
Anthropic 2026 Q2 첫 흑자 $10.9B — 직전 분기 대비 2.3배. 한 회사의 성과 발표가 아니라 에이전트 비즈니스 전체가 PoC에서 반복 운영 매출로 전환된 첫 시장 검증이다. 한국 PM이 지금 바꿔야 할 3가지 설계 변수.
한 PM이 가상 5명 팀을 운영하는 시대가 왔다. Claude Code, OpenAI Codex, Cursor 세 도구가 같은 화면 안에서 서로 다른 자리를 잡게 된 배경을 분석한다.
에이전트가 실험 단계를 넘어 SLA와 책임이 따르는 프로덕션 영역에 진입했다. PM이 지금 설계해야 할 것은 '얼마나 똑똑한 에이전트인가'가 아니라 '누가 검토하고, 누가 책임지며, 어디서 멈출 것인가'이다.
인텔리빅스 VIXA, 씨이랩, 마키나락스 국방 AI가 보여주는 패턴: 현장형 NPU 에이전트가 클라우드 종속을 벗어나면 에이전트 설계의 1차 변수가 바뀐다.
AI 코딩 에이전트는 팀 전체를 동등하게 가속하지 않는다. Andrew Ng이 명시한 프론트엔드>백엔드>인프라>리서치 차등을 PM이 팀별 기대치 재조정의 1차 책임으로 삼아야 하는 이유.
멀티에이전트 시스템에서 가장 뛰어난 모델을 오케스트레이터로 쓰는 것은 직관적이지만 위험하다. '최고 직원=최악 관리자' 원칙이 AI 에이전트 설계에서 반복되는 이유와 PM의 처방을 다룬다.
유진 얀의 'AI 협업 5원칙'이 GeekNews 63점 1위를 차지한 날, Karpathy는 Anthropic에 합류했다. 두 신호는 같은 방향을 가리킨다: AI를 도구로 쓰는 것과 함께 성장하는 시스템을 설계하는 것은 완전히 다른 역량이다.
OpenAI Codex Chronicle의 내부명은 'telepathy'였다. Anthropic은 '자기 개선'을 메모리로 정의했다. 메모리는 더 이상 부속 기능이 아니다 — 에이전트 시스템의 지속성을 만드는 핵심 운영 레이어다.
GPT-5.5가 'agent runtime'으로 자기정의한 순간, 모델 선택의 게임이 바뀌었다. raw 성능에서 완주율·time horizon·비용 세 축으로 라우팅 기준이 교체되고 있다.
PM의 역할이 기능 명세 작성에서 평가 설계로 이동하고 있다. 원티드랩 PO의 경고, LangChain CEO의 선언, 아마존 내부 실패—세 신호가 같은 방향을 가리킨다.
Cursor, Claude Code, Devin, Replit Agent — 네 도구가 같은 분기에 같은 디자인을 채택했다. 사용자 화면을 가리는 백그라운드 에이전트가 표준이 된 이유와 시장을 가르는 새 KPI '한 명의 N'을 PM 관점에서 분석한다.
Anthropic 금융 에이전트 10종, Claude for Small Business, 달파 300기업 사례가 같은 결론을 가리킨다. 에이전트 비즈니스의 경쟁 단위가 '더 좋은 모델'에서 '도메인 번들 설계력'으로 이동하는 지금, PM이 다시 물어야 할 세 가지를 정리한다.
에이전트가 코드를 만들어줘도 팀 병목이 사라지지 않는 이유를 PM 관점에서 짚는다. AI 시대 PM의 첫 번째 책임은 도구 선택이 아니라 팀 의사결정 구조 설계다.
Notion PM 맥스 슈닝은 Lenny's Podcast에서 AI 시대 차별화는 스킬이 아니라 에이전시라고 했다. Karpathy의 '이해는 위임 불가' 원칙과 함께, 지금 PM이 실제로 개발해야 할 역량을 짚는다.
채널코퍼레이션 알프는 월 100만 건 상담의 80%를 사람 없이 해결한다. 이 수치는 모델 선택이 아니라 11년 도메인 데이터와 룰 가드레일로 만들어졌다. 버티컬 에이전트의 진짜 경쟁은 지금 도메인 설계에서 벌어지고 있다.
Microsoft의 '에이전트 50개 = 50인분 라이선스' 발언이 촉발한 과금 단위 전쟁. seat에서 usage, 그리고 outcome으로 진화하는 에이전트 가격 모델을 PM 관점에서 분석한다.
AI 에이전트가 실행 권한을 가지는 순간, 키워드 필터는 구조적으로 우회된다. HEARTBEAT 보안 우회 사례부터 Crucible 의미 탐지, Anthropic Glasswing까지 — 에이전트 보안의 새 설계 기준을 정리했다.
와튼 스쿨 연구가 명명한 '인지적 항복(Cognitive Surrender)' — AI 성능이 높아질수록 검증 의지가 낮아지는 이 구조적 패턴이 왜 AI 거버넌스의 새로운 핵심 변수인지 PM 관점으로 분석한다.
벤치마크 순위로 모델을 고르던 시대가 끝나고 있습니다. 에이전트 시스템을 실제로 운영하면 모든 호출이 비용이 되고, 비용이 설계 변수가 됩니다. '1달러당 성능'과 라우팅 설계가 AI PM의 새 레버리지입니다.
에이전트가 코드를 짜는 시대, PM 역할은 줄어드는가? Andrew Ng의 경고와 삼성SDS 5% 도입 현실이 가리키는 것은 같다 — 병목은 코드가 아니라 무엇을 만들지 결정하는 구조다.
ServiceNow, Grok 4.20, OpenAI Codex Chronicle — 전혀 다른 세 곳이 같은 결론에 도달했습니다. 에이전트 오케스트레이션의 진짜 경쟁 축은 모델 성능이 아니라 컨텍스트 설계입니다. Context-first 패턴 3가지와 PM 관점 시사점을 정리합니다.
McKinsey 2024 데이터에 따르면 기업 AI 도입률은 72%에 달합니다. PM의 역할은 '문서 작성자'에서 '에이전트 오케스트레이터'로 이미 바뀌고 있습니다. 왜 지금이 전환점인가.
ChatGPT도 코드를 씁니다. Copilot도 자동완성합니다. 그럼 Claude Code는 무엇이 다른가? 파일시스템 접근, 에이전트 실행, CLI 환경의 차이를 PM 관점에서 정리합니다.
Claude Code의 .claude/agents/ 폴더에 에이전트를 정의하면 PM은 사실상 팀장이 됩니다. 리서처·엔지니어·마케터 에이전트를 병렬로 실행하는 멀티 에이전트 워크플로우를 설계하는 방법.