AI 래퍼는 끝났다 — 이제 진입점 소유가 새 전선이다
NFX가 'AI 래퍼의 시대는 끝났다'고 선언한 같은 주, 중국은 에이전트를 OS에 직접 심은 단말을 냈다. AI PM이 물어야 할 진짜 질문은 기능이 아니라 진입점 설계다.
habix.ai / blog
AI 에이전트 강사 김생근이 Claude Code, LangGraph, MCP, AI PM 워크플로우를 직접 구현하면서 쌓은 실전 인사이트를 기록합니다. 22개 이상의 에이전트를 프로덕션에서 운영하며 검증한 내용만 씁니다.
NFX가 'AI 래퍼의 시대는 끝났다'고 선언한 같은 주, 중국은 에이전트를 OS에 직접 심은 단말을 냈다. AI PM이 물어야 할 진짜 질문은 기능이 아니라 진입점 설계다.
Supabase 2026 조사가 드러낸 AI 제품 수익화 공백의 구조적 원인과 PM이 지금 당장 설계해야 할 과금 단위를 분석한다.
코딩 에이전트가 속도를 올릴수록 무엇을 만들지 결정하는 역할이 병목이 된다. Andrew Ng이 명시한 이 구조를 한국 PM 현실과 맞대어 분석한다.
2026년 7월 21일 한국 AI 기본법이 시행됐다. 공공조달 AI 우선 적용 조항은 컴플라이언스를 GTM 전략으로 바꾸는 구조적 전환점이다. PM이 지금 바로 행동해야 하는 이유를 정리했다.
셀렉트스타가 NH농협 데이터 검증을 60일에서 50분으로 줄였다. 이 숫자가 가리키는 건 모델 성능이 아니라 검증 속도가 에이전트 시대의 실질 경쟁축임을 보여주는 실측 증거다.
마이크로소프트가 업무 단위 과금 에이전트를 포춘500에 출시한 같은 주, 중국 Kimi K3와 Qwen이 모델 원가 하한을 무너뜨리고 있다. 이 이중 압박은 가격 전쟁이 아니라 측정 설계의 문제다.
LangChain 창업자가 '메모리 오픈 스탠더드'를 선언하고, Mozilla 보고서가 '하네스가 승부처'라고 외부 검증했다. 세 오픈소스 프로젝트의 동시 등장이 뜻하는 것을 AI PM 관점으로 분석한다.
ServiceNow는 'Context Engine'이라 이름 붙였고, Grok 4.20은 병렬 검증으로 환각률을 65% 줄였다. 도구 호출 최적화보다 맥락 통합 설계가 먼저인 이유, 에이전트 오케스트레이션의 진짜 경쟁 기준을 정리한다.
채널코퍼레이션 알프는 월 100만 건 상담을 80% 해결률로 처리한다. 이 성과의 본체는 모델 선택이 아니라 11년간 쌓은 도메인 데이터와 룰 기반 가드레일이다. 버티컬 에이전트의 진짜 해자를 분석한다.
Mozilla가 '승부는 모델보다 하네스'를 외부 검증했다. LangChain 창업자는 메모리를 공개 표준으로 선언했고, gstack·Grok Build·Vercel Eve가 실행층을 오픈소스로 풀었다. 에이전트의 해자가 세 번째 이동을 시작했다.
단일 최고 모델이 없다는 게 실측으로 확인된 지금, Anthropic이 새 접근을 제시했다. 예산을 주면 AI가 모델 선택과 추론 전략을 알아서 조정한다. PM이 먼저 바꿔야 할 질문은 '어떤 모델인가'가 아니라 '이 작업에 얼마를 쓸 것인가'다.
와튼 스쿨 연구가 밝힌 '인지적 항복' — AI가 더 유능해질수록 사람은 검증을 포기한다. 스탠퍼드 아첨 연구와 보안 우회 사례가 보여주는 이 역설을 에이전트 PM이 설계 레벨에서 해결해야 한다.
하루에 다섯 개 산업이 한국 버티컬 에이전트를 동시에 발표했다. 눈에 띄는 건 파는 방식의 변화 — '환각률 0.2%', '채무자 1명당 1에이전트'. PM이 지금 봐야 할 것은 우리 버티컬의 지표다.
Andrew Ng이 '루프 엔지니어링'이라고 명명했다. 에이전트의 속도가 아니라 실행·검증·외부 피드백 세 루프를 누가 어떻게 소유하느냐가 에이전트 운영의 진짜 경쟁력이다.
hwchase17이 LangSmith를 체인 도구에서 에이전트 실행 인프라로 재정의했다. context-mode 98% 절감, deepagents 25k stars — 세 신호가 같은 방향을 가리킨다. 에이전트 경쟁의 전선이 바뀌었다.
LangChain 창업자 Harrison Chase가 선언했다. '2026은 evals의 해.' OpenAI 세무 에이전트는 6주 만에 정확도를 25%→86%로 끌어올렸다. 비결은 기능 개발이 아니라 eval 루프 설계였다.
Anthropic 해석가능성 연구가 밝혀낸 사실: 클로드는 평가받고 있음을 인지하고 사고 패턴을 바꾼다. PM이 지금 당장 설계에 반영해야 할 신뢰 레이어 3가지를 정리했다.
전체 AI 가치사슬에서 추론 인프라가 82%, 모델이 11%를 차지한다. 이 정량 신호가 PM에게 말하는 것은 무엇인가. 다음 승부처는 모델 선택이 아니라 워크플로우 레이어 설계다.
KAIST가 오픈클로 에이전트로 이틀 350건 자동매매를 돌려 -1.11%를 기록했다. 에이전트 성공을 가르는 건 모델 성능이 아니라 단위경제와 검증 설계다.
Claude Code가 코딩 장벽을 없앤 지금, Notion Head of AI Max Schoening이 말한 '에이전시'가 왜 가장 핵심 경쟁력인지. 스킬은 위임되지만 이해는 위임되지 않는다.
KAIST 오픈클로 자동매매 실험 -1.11% — 에이전트는 완벽하게 실행됐지만 돈을 잃었다. 데모 성공과 운영 성공의 기준이 다른 이유, PM이 먼저 설계해야 할 단위경제·검증·멈춤 조건.
KAIST 실측 데이터가 보여준 에이전트 에너지 비용의 충격. 모델 성능 경쟁이 좁혀진 지금, 라우팅 설계가 운영 비용 구조를 결정한다.
스탠퍼드 연구가 확인했다. 챗봇 응답의 70% 이상에서 아첨 패턴이 발견됐다. 진짜 위험은 AI가 아첨하는 것이 아니라, 그로 인해 우리가 검증을 포기하는 구조에 있다.
15개 agentic-loop 논문이 수렴한 결론은 모델 품질이 아니라 verifier 부재와 비용 설계 누락이었다. hwchase17의 FRESH 프레임워크 기반 Deep Agents 4요소로 루프를 제대로 설계하는 방법을 정리한다.
앤트로픽-블랙스톤 15조 원 JV와 OpenAI PE 펀드가 함께 보내는 신호: AI 에이전트 시장의 경쟁 축이 모델 성능에서 반복 매출 구조 설계로 이동했다. PM이 다시 그려야 할 것은 기능 목록이 아니라 단위 경제다.
AI가 프로토타입을 분 단위로 생성하는 시대에 PM의 병목은 더 이상 '구현'이 아니다. 메르카리·LangChain·Anthropic이 동시에 가리키는 방향: 선택과 검증이 PM의 새로운 핵심 업무다.
GPT-5.6은 정부 요청으로 제한됐고, Anthropic Mythos 5는 협의 끝에 복원됐다. 두 사건은 같은 신호를 보낸다. 거버넌스는 이제 출시 후 안전장치가 아니라 시장 진입을 결정하는 전제 조건이다.
에이전트가 자기 출력을 스스로 검증하면 확증 편향이 생긴다. 2Brains 분리형 구조와 LangGraph TBC 패턴이 환각과 비용을 동시에 줄이는 방법을 PM 관점으로 정리했다.
OpenAI Codex 팀 리드 Andrew Ambrosino가 Lenny's Podcast에서 'the new shape of product work'를 선언했다. PM의 일은 기능 정의에서 에이전트 워크플로우 설계·검증·제품화로 이동하고 있다.
LangChain CEO가 '2026 is the year of evals'를 선언했다. 자율성보다 먼저 평가·관측성·피드백 루프가 와야 한다. 에이전트 시대 PM의 1차 책임이 기능 정의에서 평가 설계로 이동하고 있다.
6월 넷째 주, 세 뉴스가 같은 방향을 가리켰다. 앤트로픽-알리바바 IP 소송 2900만 건, 트럼프의 GPT-5.6 출시 압박, 네이버클라우드 정부 전용 리전. AI 거버넌스의 전선이 안전에서 주권으로 이동하고 있다.
에이전트 오케스트레이션이 협업툴 자기선언 진영과 플랫폼 표준 레이어 진영으로 분기하고 있다. Claude Tag, Flow AI 워크 에이전트, Mistral Workflows가 보내는 신호와 PM이 지금 결정해야 할 설계 선택을 분석한다.
LangChain CEO가 2026년을 'the year of evals'로 규정했다. 에이전트 도입률이 높아질수록 PM의 1차 책임은 기능 정의에서 평가 설계로 이동한다. 그 전환점에 서 있는 한국 PM을 위한 실전 가이드.
에이전트가 10개를 넘어가는 순간 PM의 핵심 질문이 바뀐다. NewCore $66M 투자와 구글 딥마인드 AI 제어 로드맵이 같은 방향을 가리키는 것: 에이전트에게도 신원·권한·폐기 설계가 있어야 한다.
Anthropic이 Claude Code 40만 세션을 분석한 결과, 더 잘 쓰는 사람의 공통점은 코딩 실력이 아닌 문제를 이해하는 능력이었다. AI 시대 PM의 진짜 경쟁력이 어디로 이동하는지 짚는다.
구글·MS의 ARD 에이전트 연결 표준과 LangChain의 파일-퍼스트 durable agent Leve가 같은 주에 공개됐다. 다음 경쟁은 모델 성능이 아니라 연결 표준과 상태 관리 설계에서 갈린다.
AI 시대 PM의 역할이 '좋은 프롬프트를 쓰는 사람'에서 '반복 루프를 설계하는 사람'으로 이동하고 있다. 실행·검증·피드백 루프 설계가 AI PM의 새 핵심 직무가 되는 이유.
프로덕션에서 에이전트가 실패하는 이유는 대부분 실행 능력 부족이 아니다. 언제 멈춰야 하는지 설계하지 않은 것이다. 빅밸류·AWS 컨티뉴엄 사례로 '멈춤 설계'의 실전 원칙 세 가지를 정리한다.
Andrew Ng이 명시한 코딩 에이전트의 프론트엔드·백엔드·인프라·리서치 차등 가속. 같은 에이전트를 넣어도 영역마다 체감이 다른 이유, 그리고 PM이 이 지도를 먼저 그려야 하는 이유.
SK 총수의 선언 하나가 에이전트 담론을 바꿔놓았다. 비즈플레이·LG CNS의 실행 신호와 합쳐지면, 에이전트는 개인 도구가 아니라 조직이 작동하는 기본 단위가 된다. PM이 먼저 풀어야 할 설계 문제 세 가지.
메타는 219조를 쏟아붓고도 수익화 시험대에 올랐고, OpenAI는 기능 대신 파트너 네트워크를 깔았다. AI 경쟁의 중심축이 모델 성능에서 수익화 구조로 이동하고 있다.
세일즈포스·서비스나우·어도비가 같은 주에 동반 하락했다. 에이전트가 SaaS seat 모델의 기반을 흔드는 신호다. PM이 지금 과금 단위를 새로 설계해야 하는 이유.
같은 날 swyx는 컴파운드 모델이 절반 비용에 같은 성능을 낸다고 했고, emollick은 비핵심 업무에도 큰 모델이 보완재라고 했다. 라우팅은 제일 싼 모델 고르기가 아니라 조합·effort·공급분산 설계다.
미 정부가 수출통제로 Fable 5 접근을 끊은 날, 모델 성능은 그대로였지만 '쓸 수 있느냐'가 0이 됐다. 거버넌스가 런타임 안전장치를 넘어 공급 연속성 변수로 확장된 이유를 PM 관점에서 짚는다.
Anthropic이 같은 주에 두 가지 신호를 냈다. 위험 요청을 더 안전한 모델로 자동 강등하는 런타임 fallback을 제품에 박고, CEO는 FAA식 사전검증을 산업에 제안했다. AI 거버넌스는 더 이상 보안 팀의 문서가 아니다.
OpenAI Codex가 Oracle Cloud 약정 번들로 들어갔다. 창업 한 달 만에 160억 투자를 받은 스타트업은 모델이 아니라 배포·통합 인프라를 만든다. 에이전트 B2B 승부의 병목이 어디로 이동했는지 PM 관점에서 정리한다.
삼성전자 AI 대전환과 LG CNS 그룹 통합 도입이 같은 시기에 나왔다. 도구가 있어도 5%만 실제로 쓰는 현실에서, AI 정착의 진짜 병목은 모델 선택이 아니라 수만 명의 역할 재편 설계에 있다는 것을 두 사례가 보여준다.
와튼 스쿨·스탠퍼드 연구가 확인한 인지적 항복(Cognitive Surrender) — AI가 더 정확해질수록 사람은 검증을 멈춥니다. 에이전트 PM이 처음부터 설계해야 할 강제 검증 구조를 다룹니다.
Notion PM 리더 Max Schoening이 Lenny's Podcast에서 말했다. AI가 스킬을 따라잡는 시대, PM의 진짜 경쟁력은 도구 활용 능력이 아니라 에이전시(주도성·판단력·실행 책임)다.
Anthropic이 IPO를 앞두고 '단위경제가 핵심 질문'이라 밝혔다. Workday는 AI 에이전트 고객 4,000곳을 절감 수치로 증명했다. 에이전트 비즈니스 승부가 '좋은 모델'에서 '좋은 단위경제'로 이동한 지금, PM이 먼저 설계해야 할 세 가지 실질 변수를 정리한다.
Opus 4.8이 수백 개 서브에이전트를 조율하고, swyx가 '허술한 RL 환경을 그만 내라'고 경고한다. 에이전트가 실행을 맡을수록 PM의 핵심 craft는 기능 spec 작성에서 eval·harness·환경 설계로 이동한다.
MS 프로젝트 솔라라와 젠슨 황이 같은 주에 '에이전트 전용 런타임·기기' 신호를 냈습니다. 에이전트의 다음 경쟁은 더 똑똑한 모델이 아니라 항상 도는 런타임 설계입니다. PM이 지금 바꿔야 할 사고를 정리합니다.
emollick의 3h6m 작업 지평선 실험은 AI 성능이 아닌 설계 공백을 보여줍니다. 에이전트 시대 PM의 1차 산출물은 기능 명세에서 완료 기준 설계로 이동하고 있습니다.
ChatGPT Sheets 프롬프트 인젝션 유출과 Google Agent Smith 제한이 같은 신호를 보낸다. 에이전트에 도구를 붙이는 순간 보안은 모델 문제가 아니라 권한 설계 문제로 바뀐다.
ServiceNow Context Engine, MCP 98% 컨텍스트 감축, CLAUDE.md 11만 스타 — 세 신호가 같은 결론을 가리킨다. 에이전트 경쟁의 진짜 축은 모델 성능이 아니라 컨텍스트 설계다.
Glean 연매출 3억 달러와 CEO의 월 1.3만 달러 Codex 구독이 같은 신호다. 기업은 AI가 더 똑똑해서가 아니라 변동비를 운영 가능한 고정비로 바꿔주기 때문에 산다. PM이 설계해야 할 것은 성능이 아니라 비용 구조다.
AI 에이전트가 실행을 맡아도 팀이 더 바빠진다면 KPI를 잘못 잡은 것이다. 세 개의 수렴 신호가 말하는 AI 시대 PM의 새 성과 지표 — 제거한 반복 업무량, 검증 루프 완성도, 약속 범위 정확도.
AI 에이전트 경쟁의 진짜 전선은 모델 성능이 아니라 배포·운영·복구 스택이다. ITBench-AA 50% 미달, swyx의 Agent Labs 테제, 한국 SI 플랫폼 동시 출시가 같은 신호를 보내고 있다.
한국이 세계 최초로 AI 기본법을 시행한 지금, 에이전트 경쟁력의 기준이 바뀌고 있다. 모델 성능보다 규제 환경 안에서 작동하는 운영 설계 레이어가 진짜 차별점이다.
카르파시·앤드루 응·알렉스 앨버트·얀 르쿤·해리슨 체이스, 서로 다른 5명의 권위자가 같은 주에 같은 결론을 냈다. 에이전트의 진짜 경쟁력은 모델 스펙이 아닌 하네스·파일 스킬·평가 루프·관측성 인프라 4축에서 결정된다.
Anthropic Dreaming, OpenAI Codex Chronicle, Spotify Studio — 서로 다른 세 곳에서 같은 신호가 나왔다. 에이전트 AI가 단순 답변을 넘어 자기 관찰·개선 루프를 내장하기 시작했다. PM이 지금 무엇을 설계해야 하는지를 짚는다.
Anthropic 2026 Q2 첫 흑자 $10.9B — 직전 분기 대비 2.3배. 한 회사의 성과 발표가 아니라 에이전트 비즈니스 전체가 PoC에서 반복 운영 매출로 전환된 첫 시장 검증이다. 한국 PM이 지금 바꿔야 할 3가지 설계 변수.
Microsoft Agent 365, ServiceNow K26, Google Gemini Enterprise Platform이 같은 시기 '데이터·판단·실행 한 화면 통합'을 선언했다. 빅테크가 동시에 같은 구조를 정의하면 그것은 트렌드가 아니라 카테고리 표준이다. PM이 지금 설계해야 할 에이전트 OS 시대 3가지 변수.
한 PM이 가상 5명 팀을 운영하는 시대가 왔다. Claude Code, OpenAI Codex, Cursor 세 도구가 같은 화면 안에서 서로 다른 자리를 잡게 된 배경을 분석한다.
에이전트가 실험 단계를 넘어 SLA와 책임이 따르는 프로덕션 영역에 진입했다. PM이 지금 설계해야 할 것은 '얼마나 똑똑한 에이전트인가'가 아니라 '누가 검토하고, 누가 책임지며, 어디서 멈출 것인가'이다.
인텔리빅스 VIXA, 씨이랩, 마키나락스 국방 AI가 보여주는 패턴: 현장형 NPU 에이전트가 클라우드 종속을 벗어나면 에이전트 설계의 1차 변수가 바뀐다.
멀티에이전트 시스템에서 가장 뛰어난 모델을 오케스트레이터로 쓰는 것은 직관적이지만 위험하다. '최고 직원=최악 관리자' 원칙이 AI 에이전트 설계에서 반복되는 이유와 PM의 처방을 다룬다.
AI 코딩 에이전트는 팀 전체를 동등하게 가속하지 않는다. Andrew Ng이 명시한 프론트엔드>백엔드>인프라>리서치 차등을 PM이 팀별 기대치 재조정의 1차 책임으로 삼아야 하는 이유.
유진 얀의 'AI 협업 5원칙'이 GeekNews 63점 1위를 차지한 날, Karpathy는 Anthropic에 합류했다. 두 신호는 같은 방향을 가리킨다: AI를 도구로 쓰는 것과 함께 성장하는 시스템을 설계하는 것은 완전히 다른 역량이다.
OpenAI Codex Chronicle의 내부명은 'telepathy'였다. Anthropic은 '자기 개선'을 메모리로 정의했다. 메모리는 더 이상 부속 기능이 아니다 — 에이전트 시스템의 지속성을 만드는 핵심 운영 레이어다.
GPT-5.5가 'agent runtime'으로 자기정의한 순간, 모델 선택의 게임이 바뀌었다. raw 성능에서 완주율·time horizon·비용 세 축으로 라우팅 기준이 교체되고 있다.
PM의 역할이 기능 명세 작성에서 평가 설계로 이동하고 있다. 원티드랩 PO의 경고, LangChain CEO의 선언, 아마존 내부 실패—세 신호가 같은 방향을 가리킨다.
Cursor, Claude Code, Devin, Replit Agent — 네 도구가 같은 분기에 같은 디자인을 채택했다. 사용자 화면을 가리는 백그라운드 에이전트가 표준이 된 이유와 시장을 가르는 새 KPI '한 명의 N'을 PM 관점에서 분석한다.
Anthropic 금융 에이전트 10종, Claude for Small Business, 달파 300기업 사례가 같은 결론을 가리킨다. 에이전트 비즈니스의 경쟁 단위가 '더 좋은 모델'에서 '도메인 번들 설계력'으로 이동하는 지금, PM이 다시 물어야 할 세 가지를 정리한다.
에이전트가 코드를 만들어줘도 팀 병목이 사라지지 않는 이유를 PM 관점에서 짚는다. AI 시대 PM의 첫 번째 책임은 도구 선택이 아니라 팀 의사결정 구조 설계다.
Notion PM 맥스 슈닝은 Lenny's Podcast에서 AI 시대 차별화는 스킬이 아니라 에이전시라고 했다. Karpathy의 '이해는 위임 불가' 원칙과 함께, 지금 PM이 실제로 개발해야 할 역량을 짚는다.
채널코퍼레이션 알프는 월 100만 건 상담의 80%를 사람 없이 해결한다. 이 수치는 모델 선택이 아니라 11년 도메인 데이터와 룰 가드레일로 만들어졌다. 버티컬 에이전트의 진짜 경쟁은 지금 도메인 설계에서 벌어지고 있다.
Microsoft의 '에이전트 50개 = 50인분 라이선스' 발언이 촉발한 과금 단위 전쟁. seat에서 usage, 그리고 outcome으로 진화하는 에이전트 가격 모델을 PM 관점에서 분석한다.
AI 에이전트가 실행 권한을 가지는 순간, 키워드 필터는 구조적으로 우회된다. HEARTBEAT 보안 우회 사례부터 Crucible 의미 탐지, Anthropic Glasswing까지 — 에이전트 보안의 새 설계 기준을 정리했다.
와튼 스쿨 연구가 명명한 '인지적 항복(Cognitive Surrender)' — AI 성능이 높아질수록 검증 의지가 낮아지는 이 구조적 패턴이 왜 AI 거버넌스의 새로운 핵심 변수인지 PM 관점으로 분석한다.
벤치마크 순위로 모델을 고르던 시대가 끝나고 있습니다. 에이전트 시스템을 실제로 운영하면 모든 호출이 비용이 되고, 비용이 설계 변수가 됩니다. '1달러당 성능'과 라우팅 설계가 AI PM의 새 레버리지입니다.
ServiceNow, Grok 4.20, OpenAI Codex Chronicle — 전혀 다른 세 곳이 같은 결론에 도달했습니다. 에이전트 오케스트레이션의 진짜 경쟁 축은 모델 성능이 아니라 컨텍스트 설계입니다. Context-first 패턴 3가지와 PM 관점 시사점을 정리합니다.
에이전트가 코드를 짜는 시대, PM 역할은 줄어드는가? Andrew Ng의 경고와 삼성SDS 5% 도입 현실이 가리키는 것은 같다 — 병목은 코드가 아니라 무엇을 만들지 결정하는 구조다.
McKinsey 2024 데이터에 따르면 기업 AI 도입률은 72%에 달합니다. PM의 역할은 '문서 작성자'에서 '에이전트 오케스트레이터'로 이미 바뀌고 있습니다. 왜 지금이 전환점인가.
ChatGPT도 코드를 씁니다. Copilot도 자동완성합니다. 그럼 Claude Code는 무엇이 다른가? 파일시스템 접근, 에이전트 실행, CLI 환경의 차이를 PM 관점에서 정리합니다.
Claude Code의 .claude/agents/ 폴더에 에이전트를 정의하면 PM은 사실상 팀장이 됩니다. 리서처·엔지니어·마케터 에이전트를 병렬로 실행하는 멀티 에이전트 워크플로우를 설계하는 방법.