브라우저를 대신 클릭하는 비서가 아니다. 현재 작업물의 반례를 만들고, 사람이 같은 화면에서 판정하는 협업 도구다.
WebMCP가잘 푸는 40가지
WebMCP의 특화 영역은 업종이 아니라 상호작용 구조다. 라이브·미저장 상태, 사이트가 소유한 의미 구조, 반례와 영향 범위, 같은 화면의 인간 판정, preview와 undo가 한 루프로 닫힐 때 가장 강하다.
- ARCHIVE
- 최초 10 + 재구성 10 + 신규 20
- COLLECTIVE
- 3개 에이전트 · 2라운드 교차심사
- TRUTH
- 제품 가설 · 시장·결제 검증 전
40 / 40
← 좌우로 밀어 6개 문제 원형 비교 →
BOUNDARY / LIVE COUNTEREXAMPLE WORKBENCH
산업이 아니라, 같은 객체를 함께 판정하는 구조
사람은 캔버스·표·타임라인을 보고, 에이전트는 그 뒤의 객체 ID·규칙·선택·미저장 상태를 읽는다. 둘은 같은 대상을 다른 표현으로 보고 반례, 대안, 수정안을 함께 닫는다.
가장 빠른 기각 질문: “탭을 닫은 뒤에도 이 일을 완벽히 끝낼 수 있는가?” 그렇다면 MCP·API·백그라운드 job이 본체일 가능성이 높다.
MCP · API · Job
영구적 서버 데이터, 대량 배치, 무인 실행, 긴 모니터링. 현재 viewport가 없어도 결과 품질이 유지된다.
Playwright · RPA
여러 사이트의 반복 클릭, 크로스 브라우저 회귀, DOM 기반 경로 실행. 인간의 즉석 판정보다 자동화 범위가 중요하다.
MCP + 별도 앱
백엔드 계산이 본체이고 검토 UI는 독립적이어도 되는 일. WebMCP는 마지막 review surface로만 보조한다.
WebMCP
현재 선택·playhead·미저장 초안이 중요하고, 결과가 동일 객체에 보이며, 사람이 의도·감각·책임을 판정해야 한다.
현재 공식 문서 기준으로 site tools는 열린 페이지와 로그인 세션을 사람·에이전트가 함께 사용하게 한다. 도구는 페이지에 속해 이동하거나 닫으면 사용할 수 없게 될 수 있고, ChatGPT 내장 브라우저는 top-level JavaScript 등록을 사용해야 하며 iframe과 선언형 API는 현재 지원하지 않는다. 출품 직전에는 지원 범위를 다시 확인해야 한다.
METHOD / DIVERGE → CROSS-EXAMINE → CONVERGE
아이디어를 많이 낸 뒤, 다른 관점이 탈락시켰다
기술 순도, 운영시장, 인터랙티브 경험의 세 에이전트가 독립적으로 발산했다. 1라운드 상위 후보를 공유한 뒤 2라운드에는 자기 분야가 아닌 후보까지 다시 심사했다.
| 단계 | 후보 수 | 무엇을 했나 | 통과 조건 |
|---|---|---|---|
| 기존 원장 대조 | 20 | 최초 리서치 10개와 후속 문제원형 재구성 10개를 별도 후보로 복원 | 삭제하지 않고 승격·강등·대체 이유 연결 |
| 1차 발산 | 44 | 개발·보안·과학 / 운영·마케팅·재무 / 게임·디자인·교육으로 독립 발산 | 라이브 상태, 같은 화면 판정, preview·undo 필수 |
| 분야별 자체심사 | 24 | 각 분야 상위 8개를 결선으로 이동 | 기존 20개와 의미 중복 금지 |
| 교차심사 | 20 | 순도·시장성·3분 데모성으로 서로의 후보를 재평가 | 다른 기술로 옮길 때 핵심 경험이 실제로 손실 |
순위와 점수는 집단지성의 비교 가설이다. 사용자 인터뷰, 실제 업무시간, 지불 의사, 유료 파일럿, 오탐률을 측정하지 않았다. “시장성이 입증됐다”거나 “시간을 절반으로 줄인다”는 주장은 아직 할 수 없다.
EDITOR'S TOP 5 / BUILD ORDER
내가 지금 만든다면, 이 다섯 개부터 검증한다
이 순위는 시장이 입증한 매출표가 아니다. WebMCP가 아니면 핵심 경험이 무너지는가와 첫 고객이 손실·시간 절감을 바로 이해하는가를 함께 본 편집 추천이다. 1위는 첫 유료 파일럿, 2–5위는 다음 검증 순서다.
편집 가중치 · WebMCP 고유성 30% · 반복 수작업과 손실 25% · 인간 판정의 필수성 20% · 72시간 데모성 15% · 초기 통합 난이도 10%
두 독립 평가에서 기술 순도 1위와 사업성 1위가 달랐다. 아래 순위는 그 충돌을 숨기지 않고 합친 제품 가설이다. 실제 반복 빈도, 절감액, 추가 발견률, 지불 의사 중 하나라도 약하면 순위는 바뀐다.
-
R02 · 마케팅·커머스 · 먼저 만들 것
Promo Stack Fuzzer
게시 전에 ‘가장 많은 돈이 새는 장바구니’를 만들어, 충돌하는 할인 규칙만 고친다.
FIRST PAID PILOT- 왜 1위인가
- 쿠폰·회원가·무료배송·묶음 할인의 수작업 조합 검사는 반복되고, 실패 비용은 곧 마진 손실이다. 운영자·마케터·에이전시라는 구매자도 명확하다.
- 왜 WebMCP인가
- 현재 미게시 프로모션 초안에서 반례 장바구니를 같은 편집기에 재생하고, Agent가 할인 적용 순서와 최소 rule diff를 보여준 뒤 사람이 의도된 정책인지 승인한다.
- 첫 검증 / 탈락
- 규칙 6개·상품 12개·반례 4개 sandbox로 발견 손실액과 판정 시간을 잰다. 실제 변경이 드물거나 방지액이 구독료보다 작으면 1위에서 내린다.
할인이 많아질수록 좋은 것이 아니다. Agent는 손실 반례를 만들고, 사람은 어떤 혜택을 살릴지 결정한다. -
N01 · 접근성 · WebMCP 고유성 1위
Focus Recovery Theater
정적 lint가 놓치는 ‘포커스가 사라지는 순간’을 실제 화면에서 재생하고, 자연스러운 복구 순서를 사람이 고른다.
PURITY LEADER- 왜 2위인가
- 브라우저의 active element, modal stack, validation state가 문제 그 자체다. 열린 페이지를 떠나면 중요한 증거가 사라져 WebMCP 고유성이 가장 선명하다.
- 인간의 역할
- Agent는 최소 실패 경로와 두 복구안을 그리지만, 오류 뒤 어디로 포커스를 돌려야 논리적인지는 키보드·스크린리더 사용 맥락을 아는 사람이 판정한다.
- 첫 검증 / 탈락
- 3단계 form과 modal에 4개 실패를 심고 axe·Playwright 대비 추가 발견과 판정 시간을 잰다. 추가 발견이 거의 없거나 의미 상태를 못 읽으면 탈락한다.
검사 결과 목록이 아니라, 실제 키보드 이동이 막히는 장면과 복구 선택을 같은 화면에 둔다. -
R01 · 업무 자동화 · 전체 균형 1위
FlowPath Debugger
성공처럼 보이지만 결과가 틀린 자동화 흐름을 최소 반례 하나로 드러낸다.
BEST BALANCE- 왜 3위인가
- 미저장 그래프 → 빨간 실패 경로 → guard 수정 → 같은 입력의 녹색 재실행이 짧고 완결된다. no-code·승인 flow·규칙 편집기로 확장하기도 쉽다.
- 왜 WebMCP인가
- Agent가 현재 노드·선택·미저장 조건을 의미 단위로 읽고, 보고서가 아니라 사용자가 보고 있는 그래프 위에 실패와 수정 결과를 겹쳐 보여준다.
- 첫 검증 / 탈락
- 12개 노드 환불 flow에 semantic bug 3개를 심어 원인 발견 시간을 비교한다. 플랫폼이 의미 그래프를 노출하지 않거나 JSON 리포트만으로 충분하면 탈락한다.
‘실행 성공’ 뒤에 숨어 있던 잘못된 분기를 현재 그래프 위에서 재생하고 바로 다시 검증한다. -
R04 · 게임 QA · 가장 독창적인 테스트
State-Space Counterexample Canvas
테스터가 아직 걷지 않은 softlock 경로를 Agent가 만들고, 같은 맵에서 ‘의도된 퍼즐인가, 버그인가’를 판정한다.
GAME QA WEDGE- 왜 4위인가
- 기존 회귀 테스트는 알려진 경로를 반복하지만, 이 후보는 현재 레벨의 의미 상태에서 아직 보지 못한 최소 실패 경로를 만든다. 시연도 한눈에 이해된다.
- 인간의 역할
- 열쇠를 놓쳐 갇힌 것이 설계된 긴장인지 진짜 진행 불능인지는 solver가 확정할 수 없다. Agent는 경로를 찾고 디자이너가 의도를 판정한다.
- 첫 검증 / 탈락
- 상태 20개 이하 퍼즐과 softlock 3개로 테스터 발견률을 비교한다. headless model checker와 영상 리포트만으로 같은 판단이 되거나 엔진 통합 비용이 크면 내린다.
Agent가 아직 플레이되지 않은 실패 경로를 만들고, 레벨 디자이너가 의도와 버그의 경계를 결정한다. -
N02 · 마케팅·법무 · 시각 검토 1위
Responsive Disclosure Proximity Inspector
강한 광고 주장과 그 조건이 실제 모바일 화면에서도 함께 보이는지, 저장 전에 법무와 마케터가 판정한다.
MARKETING + LEGAL- 왜 5위인가
- 카피 내용만 맞아도 배치·crop·CTA 때문에 조건이 잘리거나 멀어질 수 있다. 마케팅과 법무가 같은 화면에서 문제를 이해하고 고를 수 있어 데모가 빠르다.
- 왜 WebMCP인가
- 현재 미저장 creative와 claim–disclosure 의미 쌍을 읽고 viewport별 거리·대비·잘림을 표시한 뒤 위치 A/B를 바로 렌더한다.
- 첫 검증 / 탈락
- creative 6개와 viewport 3개로 기존 스크린샷 검수 대비 누락과 판정 시간을 잰다. 정적 검수만으로 충분하거나 법적 적합성 자동 보증을 요구받으면 탈락한다.
문구가 존재하는지만 보지 않는다. 주장과 조건이 실제 작은 화면에서 함께 읽히는지를 판정한다.
Localization Layout Repair는 도입이 쉽지만 기존 시각 회귀 도구와 겹치고, API Contract Breakage Rehearsal은 기업 예산이 크지만 CI 경쟁이 강하다. Motion Feel Pair Editor는 가장 순수한 인간–Agent 협업이지만 초기 ROI를 숫자로 증명하기 어려워 이번 Top 5 밖에 뒀다.
PRIMARY LEDGER / 40 IDEAS
기존 20개를 보존하고, 서로 다른 20개를 더했다
원안은 최초 분야별 리서치, 재구성은 WebMCP 문제 원형을 다시 정의한 후의 아이디어, 신규는 이번 집단지성 라운드에서 살아남은 후보다. 필터는 문서 내용을 지우지 않고 현재 보기만 좁힌다.
CORRECTION LOG / KEEP THE OLD CLAIM
틀린 범위와 약한 아이디어를 지우지 않았다
처음에는 최신 답변의 10개만 기존 아이디어로 계산해 30개 아카이브를 계획했다. 최초 리서치 10개가 별도 원안임을 확인한 뒤 40개로 정정했다.
| 이전 후보 | 지금의 판정 | 살아남는 조건 또는 후속 후보 |
|---|---|---|
| Offer Truth Diff | 조건부 유지 | 여러 외부 광고 사이트 순회가 아니라 자사 캠페인 워크스페이스의 현재 초안이어야 한다. |
| ReproLab | 유지 + 확장 | 알려진 실패 재현은 ReproLab, 아직 보지 못한 실패 상태 생성은 State-Space Counterexample Canvas로 분리한다. |
| Catalog Import Mapper | 조건부 유지 | 파일 변환만 하면 일반 AI다. 현재 카탈로그와 미저장 매핑, 같은 grid의 부분 승인이 필요하다. |
| Support Flight Recorder | 조건부 강등 | 로그 요약이 아니라 현재 계정 UI에 실패 전이를 불러와 사람이 재생·판정할 때만 WebMCP다. |
| Claim Evidence Gate | 1차 후보에서 제외 | 정적 문서·RAG로 대부분 가능하다. Responsive Disclosure처럼 현재 creative 배치가 판단을 바꿔야 한다. |
| Promo Stack Fuzzer | 상업 1위 유지 | 퍼징 계산은 backend여도, 현재 draft에서 반례 cart를 재생하고 사람이 의도를 판정하는 화면이 제품 중심이어야 한다. |
DIVERGENCE LEDGER / NOT COUNTED IN 40
사라진 아이디어도 다음 중복을 막는 근거다
아래 후보들은 아이디어가 나빠서가 아니라 기존 40개와 겹치거나, backend·CI·전용 도구가 본체이거나, 책임과 시뮬레이션 정확성이 72시간 MVP를 압도해 본선 40개에서 제외했다.
SOURCES / CLAIM BOUNDARY
표준의 사실과 제품 가설을 분리한다
공식 문서는 WebMCP의 생명주기와 구현 경계를 뒷받침한다. 40개 제품의 수요와 구매성은 에이전트 패널의 가설이며 별도 검증 대상이다.
이번 세션에서 기존 원장 20개를 대조하고, 세 서브에이전트가 44개 신규 후보를 제출했으며, 분야별 24개 결선과 세 관점 교차심사를 거쳐 신규 20개를 확정했다. HTML, 검색·필터, 모바일·데스크톱 렌더, detector 검사는 산출물 검증 범위다.
실제 고객의 반복 빈도, 절감 시간, 오탐 허용도, 지불 의사, 법무·의료·과학적 책임 수용성은 검증하지 않았다. 안전한 다음 단계는 하나의 후보를 합성 데이터로 구현하고 타깃 사용자 5명에게 수작업 대비 발견률·판정시간·재사용 및 유료 파일럿 의사를 묻는 것이다.