체크권장
업무 범위“하위 업무 분할 + 좁은 도메인”부터 시작. MAS 자체가 목적이 아니라 ROI > LLM비용 검증 선행
프레임워크 선택LangGraph/AutoGen – 세밀제어, ② CrewAI – 빠른 프로토타이핑 (단, 작은 스코프)
관측성·Fallback에이전트 단계별 로그 저장, 재시도, 타임아웃, 스텝별 유효성 검사 내장
비용 모델링Anthropic 연구 사례: 멀티에이전트 토큰 비용 단일 대비 ➟ 15× 증가 ondrej-popelka.medium.com. 고부가 작업 외엔 적자 위험
조직 문화MAS == “AI 팀원” → 실제 운영은 DevOps + PromptOps + DataOps가 한몸으로 모니터링 필요
. 정리
  • “멀티 에이전트 = 허상” → 과장된 기사(기업 홍보) 비중 큰 건 사실.

  • 그럼에도 LinkedIn·Uber 같이 실사용 사례도 생겨 “완전 거품”이라 보긴 어렵다.

  • 다만 성공 사례는 ① 작업 범위 극도로 좁힘, ② Low-level 컨트롤/옵저버빌리티 확보, ③ 인간 검수 단계 유지라는 공통점을 갖는다.

  • CrewAI 등 고수준 툴은 아직 “복잡도↑ → 안정성↓” 병목을 해결 못해 대규모 프로덕션엔 미달. 사용자 체감(당신 경험)과 동일한 결론.

따라서 2025년 현재 MAS는 “국지적·제한형 상용화” 상태.
‘모든 로직을 만능 에이전트에 맡긴다’는 광고는 거품이며, 프레임워크를 고를 땐 통제 가능 범위관측성 도구부터 확인하는 것이 현실적 접근이다.



이게 내 실제 경험과 일치함

---

 웰스파고 사례는 단일 에이전트 기반 LLM임 단일 에이전트 +리트리버임 DOw Chemical도 코파일럿 기반 자동화->멀티 아니고 단일 에이전트임 Grupo Bimbo-> 650개의 AI를 붙인거고, 멀티 에이전트라면 역할 기반 협력+공동 목표가 있어야하는데 그게 아니라, 그냥 LLM 모델 많이 붙여서 자동화한거 여기서 ChatDev인데 ChatDev는 그냥 단순 역할놀이고, 이걸로 돈을 번다 안번다 정해진게 없음 CrewAI는 내가 직접 써봤어서 실제로 써보면 그냥 '출시만했다' 수준임 따라서 환각이라는거임 위가 GPT 4o3 답변 아래가 내 답변인데 누구 말이 맞는지 말해보렴
---


이게 내 질문이고, 너가 아까 O3 답변 + 내 질문 2개 붙여서 물어봄


실제로 대다수 사용해본 결과 그럼


즉 자동화 할 수 있는 부분을 멀티 에이전트로 늘릴 수 있는거자체는 부정하지 않지만 실제 현실과 동떨어짐


그러니까 멀티 에이전트를 못짜서가 아니라, 지금 전반적으로 다 처리할 수 있는 그런게 없음


그냥 철처하게 '현실적으로 통제된 분류 작업에서' 이렇게 쓰이는게 다임