내 검토위원회는 아직 한 번도 '아니오'라고 말한 적이 없었다
무인 게시 파이프라인에 LLM 심사 단계를 넣고 '검증 완료'라고 커밋했습니다. 검증 내용은 일본어 5편 전원 승인. 승인만 있는 검증이 게이트에 대해 무엇을 증명하는지 따져 봅니다.
AI 코딩 에이전트에 일을 위임하고 검토하며 제약을 거는 실전 워크플로.
무인 게시 파이프라인에 LLM 심사 단계를 넣고 '검증 완료'라고 커밋했습니다. 검증 내용은 일본어 5편 전원 승인. 승인만 있는 검증이 게이트에 대해 무엇을 증명하는지 따져 봅니다.
설치→결제 0.62%가 어디서 죽는지 파고들었습니다. 가설에 맞는 앱 14개를 코드에서 찾아냈는데, 실제 결함은 하나뿐이었습니다.
새 SDK에서 채택할 API 다섯 건을 골라 여러 앱에 심었습니다. 전부 되돌렸고, 이틀 뒤 '확인됐다'고 적어둔 세 건도 전부 무너졌습니다.
각 태스크를 끝낼 때마다 리뷰를 돌렸습니다. 전부 통과했는데, 마지막에 전체를 한 번 본 리뷰가 블로커를 찾았습니다. 결함은 태스크 안이 아니라 태스크 사이에 있었습니다.
공유 인증 DB의 트리거가 모든 앱에 프로필을 만든다는 걸 알고 있었습니다. 그런데 코호트 분석의 분모로 바로 그 테이블을 썼습니다.
입력 액션으로 한국어를 넣으면 일부 음절이 다른 글자로 바뀐 채 들어갑니다. 도구는 성공으로 보고하고, 반환된 로그에도 깨진 글자가 그대로 찍혀 있습니다. 로그만 보면 못 잡습니다.
한 리포에서 AI 세션 두 개를 동시에 돌렸습니다. 파일 73개를 스테이징하고 커밋 메시지를 쓰는 사이에 다른 세션이 자기 작업을 커밋했습니다. 제 73개가 그 커밋에 통째로 들어갔습니다.
심사 대기 시간을 찍는 스크립트를 돌렸더니 한 앱만 유독 오래돼 보였습니다. 그 날짜는 제출일이 아니라 버전 생성일이었고, 실제 대기는 20시간이었습니다. 날짜 하나를 잘못 읽고 '이례적'이라는 형용사까지 만들어 붙인 이야기입니다.
코드리뷰 에이전트를 백그라운드로 띄우고 같은 파일을 계속 고쳤습니다. 결과가 어느 시점의 트리에 대한 것인지 알 수 없게 됐습니다.
훅 문구가 15자를 넘으면 채택하도록 필터를 짰습니다. "40~80자, 이모지 1개 이내로 작성하세요"도 15자가 넘습니다. 그건 훅이 아니라 제가 모델에게 준 지시문이었습니다.
이름 칸으로 들어오는 프롬프트 주입을 막겠다고 마침표를 금지했습니다. 마침표가 없는 명령문은 처음부터 통과하고 있었습니다.
앱 26개의 색을 자동으로 갈아끼우고 WCAG 대비 감사를 돌렸습니다. 결함 0. 그런데 사용자가 '폰트가 거의 안 보인다'고 했습니다. 감사가 재지 않은 것은 대비가 아니라 밝기의 역할이었습니다.

damta.ootssu.com을 bungeo.ootssu.com급으로 고품질화할 때 쓴 콘셉트 프롬프트와 배경 에셋 프롬프트 전문, 그리고 왜 그런 제약을 넣었는지 기록합니다.
iOS·안드로이드·게임 UI를 뽑아내는 프롬프트 3개를 통째로 공개합니다. 그리고 그 규칙들이 실제 출하 코드에 얼마나 남았는지 grep으로 셌습니다. 잘 지켜진 규칙 3개, 거의 무시된 규칙 3개가 나왔습니다.
매일 봇 상태를 LLM에 넣어 5줄 요약을 받았습니다. 3주 동안 '규칙대로 진행 중'이었습니다. 같은 기간 같은 예산을 그냥 들고 있었으면 20%p 더 벌었습니다. 모델은 거짓말하지 않았습니다. 제가 준 JSON에 비교 대상이 없었을 뿐입니다.
기계적인 작업을 CLI 에이전트에 자율 위임했더니, 일을 안 하고 웹 목업을 띄우거나 계획 문서만 쓰다 종료했습니다. 에이전트가 실패한 게 아니라 다른 일을 하고 있었죠 — 자동 로드된 스킬셋이 '무언가 만들어달라'를 브레인스토밍으로 읽은 겁니다. 그런데 이 가드가 분석 작업엔 무력합니다.
클릭 한 번 안 드는 프롬프트 한 문장이 이번 주에만 트래픽 대시보드와 자기개선 게이트, 두 번의 자기기만을 걷어냈다. 영리한 프롬프트가 아니라 강제 질문이라서 먹힌다.
코딩 에이전트의 가장 큰 레버는 모델도 MCP도 아니었다 — 매 턴 다시 읽히는 작은 프롬프트·스킬 라이브러리였다. 간결 모드, YAGNI 모드, '조사 먼저' 계약형 프롬프트, 그리고 한 단어짜리 자율진행 신호.
두 에이전트, 두 역할: Claude가 오케스트레이션(계획·검증·배포), Codex가 생성(디자인·콘텐츠). 핸드오프는 매니페스트로 하고, 성패는 검증 게이트에 달렸다.
적대적 검증이 붙은 팬아웃 리서치 워크플로우: 다수 검색 에이전트 뒤에 3표 반증 게이트. '유튜브 자동화 수익화가 진짜냐'에 겨눴더니, 내가 믿고 싶던 주장 대부분을 죽였다.
스펙 하나를 Codex에 넘겨 앱 수십 개의 디자인 시스템을 전면 재디자인 — 그리고 배포 직전 마지막 앱에 회귀 게이트를 건 오케스트레이터가 배치 배포.
에이전트를 자유 실행시키지 않고 대량 콘텐츠를 생성하는 법: 스키마·품질기준을 담은 SPEC.md, 검증된 파일럿 1배치, 그다음 엄격한 스키마 파싱을 게이트로 건 병렬 배치.
코딩 에이전트의 가장 큰 품질 레버는 모델이 아니라 — 설계 전 브레인스토밍, 문서화된 플랜, 어떤 '완료' 주장 전의 검증을 강제하는 프로세스다.
Model Context Protocol 서버를 실제 워크플로에서 쓰는 모습 — 브라우저 구동, Playwright로 결과 카드 캡처, Supabase DDL 실행, 그리고 각각의 함정.
frontmatter가 붙은 파일 하나에 사실 하나, 세션마다 로드되는 인덱스, 노트 간 링크. 데이터베이스 없이 에이전트가 컨텍스트를 이어가게 하는 단순하고 grep 가능한 메모리.