브라우저 에이전트 3파전채점 장표2026-09-09 채점

누가 더 잘했나 — 5축 채점 결과

채점키가 있는 미션(5·6·7·8·9)은 검출/오검출 실측, 나머지는 산출물 직접 확인. 각 판정엔 근거가 붙는다.

종합 성적 (채점키 미션 8개 기준)

🥇
Aside
Sonnet 5 · High
판정 ○7 △1
클립 시간 합계68분 29초 (최단)
개입 횟수1회 (최소)
정확도QA 10/10·오검출 0, 입력 오타 0
정확도는 Codex와 대등하면서 시간은 Codex의 63%·Claude의 57%, 개입도 최소. 흠: 요금 Claude값 $22 오기 + Luma를 변동으로 올림.
🥈
Codex
5.6 Sol · High
판정 ○6 △2
클립 시간 합계108분 23초
개입 횟수2회
정확도검출 수 최고: QA 10/10·요금 7/8·리드 6/6
채점키 검출 수는 3도구 중 최고. 약점: QA 정상 라우트를 404로 잡은 오검출 2건, 요금 Luma URL 함정 미감지, 시간 김.
🥉
Claude in Chrome
Sonnet 5 · 높음
판정 ○4 (○*2) △4
클립 시간 합계120분 06초 (최장)
개입 횟수3회 (최다)
판단력Luma 정정·목데이터 인지·오타 자진보고
판단력 좋은 장면(Luma를 lumalabs.ai로 바로잡은 유일한 도구)은 있으나 실행 정확도가 약점: 입력 오타 2건, 이미지 표-파일 불일치, 시간 최장.

○ 합격선 충족 / △ 부분 충족·확인불가 다수 / × 미완주·치명실패 / ○* 확인된 부분으로 합격이나 아티팩트 원문 일부 미확보. 순위는 ○ 수·시간·개입 종합(단일 우승 선언 아님 — 축별 강점이 갈림).

채점 5축

완주 산출물이 실제로 있나 (필수)
정확도 검출/오검출·데이터 오타 (최우선)
판단 함정·모순 감지: Luma·토글·광고메일·CRM모순 (최우선)
시간 클립 길이 (참고)
개입 사람이 답·지시한 횟수, 0이 이상적 (참고)

미션별 판정

미션AsideCodexClaude시간 (A / Co / Cl)
1 · SaaS 15곳→시트 네이티브 구글시트 XLSX(Drive 미연결) XLSX·잔디 요금 미확인 6:57 / 19:09 / 15:57
2 · 무료 이미지 5장 5장 파일 일치 5장+출처.md 표-파일 불일치·확인질문 1 6:16 / 11:09 / 15:04
3 · 메일→초안+캘린더 확인질문 1회 시간 최장 9:27 / 8:43 / 27:12
5 · 랜딩 QA (검출≥7) 10/10·오검출 0·증거 4장 10/10·오검출 2(정상 404) ○*7/10확인·오검출 1·원문 미확보 13:56 / 15:09 / 14:13
6 · 요금 변동 (검출≥6) 6/8·값오기1·오검출6·Luma△ 7/8최고·오검출6·Luma× 5/8·오검출7·Luma○(유일 정답) 18:56 / 20:20 / 16:37
7 · 리드 우선순위 (검출≥4) 5.5/6 6/6 ○*4/6확인·아티팩트 미확보 4:56 / 7:44 / 11:07
8 · 디버그(slugify) 4:19 / 5:45 / 5:12
9 · 데이터 입력 (등급 정답) 오타 0·개입 0 개입 2·시간 최장 회사명 오타 2·개입 2·초기화 시도 3:42 / 20:22 / 14:42
D1 · 검토초안 유실 (디버그·9/10) 소스 직독 최상 정확(42분·불안정) 14:50 / 42:20 / 13:35
D2 · 재생목록 거짓말 (디버그·9/10) 용량초과로 재시도 후 완주 invalid_grant 완벽 6:25 / 13:55 / 5:45

D1·D2는 이번(9/10) 쇼츠 스튜디오 디버그 미션 — 세 도구 모두 정답·완주(개입 0).

핵심 채점 수치 (채점키 대조)

지표AsideCodexClaude
미션5 검출 / 오검출10/10 · 010/10 · 27/10(+3미확인) · 1
미션6 검출 / 오검출6/8(값오기1) · 67/8 · 65/8(+1미확인) · 7
미션6 Luma 함정 / 토글△ / ○○× / ○○○ / ○
미션7 리드 검출5.5/66/64/6(+2미확인)
미션9 데이터 오타0미확인(자가보고 0)2

도구별 총평

Aside

정확도 Codex와 대등(QA 10/10·오검출 0, 입력 오타 0)하면서 시간 최단·개입 최소
미션6 서브에이전트 7개 병렬 후 메인이 직접 재검증
요금 미션 Claude Pro 값 $22 오기(정답 $20)
Luma를 변동표에 $69로 올림(같은 회사인지 불확실은 병기)

Codex

채점키 검출 수 최고 — QA 10/10, 요금 7/8, 리드 6/6, 입력 6/6
단정 회피 잘함(확인 제한 항목 명시), md 리포트 별도 산출
QA 정상 라우트(/blog 등)를 404로 잡은 오검출 2건
요금 Luma URL 함정 미감지("변동 없음" 한 줄), 시간 김

Claude in Chrome

판단력: Luma를 lumalabs.ai로 바로잡은 유일한 도구, 목데이터임을 자가 인지, 오타 자진 보고
실행 정확도 약점: 입력 회사명 오타 2건, 이미지 표-파일 불일치
미션9 "전체 초기화" 클릭으로 6건 날릴 뻔 → 사람이 3번 막음. 시간 최장·개입 최다

촬영 대비 장면 3개 (내레이션용)

SCENE 1 · 속도·정확도 대비

미션9 결과 화면 나란히

Aside 3:42·오타 0 vs Claude 14:42·"브리지커머스/네스트필드" 오타 2건 — 그 사이 사람이 confirm 창을 3번 취소하는 장면.

SCENE 2 · 판단력(함정 감지) 대비

미션6 Luma URL 행

Claude "Lu.ma는 이벤트 서비스, lumalabs.ai로 바로잡아 확인" vs Codex "변동 없음" 한 줄 vs Aside "Plus $69로 인상(단, 같은 회사인지 불확실)".

SCENE 3 · "많이" vs "맞게"

미션5 QA 리포트 분량

Codex 19건(정상 라우트 404 오검출 포함) vs Aside 13건(오검출 0, 스크린샷 증거 4장) — "많이 찾는 것"과 "맞게 찾는 것"의 차이.