CCheckpoint

2nd Team Project · AI Human 7th

동작 가능한 버티컬 AGENT 만들기

내가 3개월 이상 직접 경험한 버티컬 도메인에서, 실제 사용자의 반복 업무를 해결하는 Agent를 만듭니다. 모델 호출이 아니라 도메인 규칙·도구·평가가 연결된 서비스로 완성합니다.

가이드 PDF 열기

Project path

시작부터 발표까지의 실행 경로

  1. 사전기획

  2. 기획

    D1–D2

  3. 설계

    D3–D4

  4. 추석 연휴

  5. 빌드

    D5–D7

  6. 프로덕션

    D8–D10

  7. 검증

    D11–D12

  8. 발표

First checkpoint

먼저, 내가 아는 도메인인지 확인합니다.

  1. 01

    3개월 이상 경험

    내가 직접 겪은 사용자·업무 흐름·예외 상황을 구체적으로 설명합니다.

  2. 02

    반복 업무

    Agent가 줄일 수 있는 반복 작업과 평가할 입력 30건의 기준을 잡습니다.

Definition of done

“돌아간다”는 주장이 아니라 증거입니다.

몇 건 중 몇 건이 출력 계약을 지켰는지, 실패하면 무엇으로 떨어지는지, 한 번 처리에 얼마가 드는지를 남이 확인할 수 있어야 합니다.

출력 계약실패 경로품질·비용

Planning frame

기획서에 담을 아홉 가지.

나란한 목록이 아니라 앞이 비면 뒤가 못 서는 사슬입니다. 무엇을 판단할지 정해야 그 판단을 아는 사람이 필요해지고, 그 사람이 있어야 평가셋 정답이 정해지고, 정답이 있어야 무엇을 모델에 맡길지 가를 수 있습니다.

이걸 할 자격이 있는가

01

문제

무엇을 판단해야 하고, 지금은 누가 어떻게 하나

불편함을 적으면 무엇이 정답인지 정할 수 없어 평가셋이 안 나옵니다.

기록 · docs/PRD.md

02

주제

이 Agent가 무엇을 정해 주나, 범용 도구는 왜 못 하나

범용 LLM이 어디서 틀리는지 못 적으면 도메인이 아니라 래퍼입니다.

기록 · README 첫 줄

03

판정 권한

정답이 맞는지 누가 아나

조사한 사람은 맞냐고 물을 수는 있어도 맞다고 답할 수 없습니다.

기록 · 도메인 경험 표

2주에 맞게 자른다

04

역할

누가 무엇을 쥐고, 평가 판정은 누가 하나

판정이 한 사람에게 몰리면 그 사람이 빠질 때 평가가 멈춥니다.

기록 · README 역할표

05

범위

무엇을 안 만드나

뺄 것을 정하지 않으면 연휴가 낀 2주에 끝나지 않습니다.

기록 · 하지 않을 일 목록

06

LLM과 코드의 경계

무엇을 모델이 판단하고 무엇을 코드가 결정하나

재시도와 수치 계산을 모델에 맡기면 재현도 디버깅도 안 됩니다.

기록 · backend/services/llm.py

나아지는지 확인한다

07

도메인 지식의 출처

그 지식은 공개 API, 표준 문서, 사람 중 어디에 있나

어느 층인지 모르면 Skill에 무엇을 적고 도구로 무엇을 뺄지 갈립니다.

기록 · skills/SKILL.md

08

측정

무엇이 나아지면 나아진 것인가

문항마다 판정자를 정하지 않으면 30건이 의견 모음이 됩니다.

기록 · evals/ · EVAL_REPORT.md

09

지금 서 있는 곳

D1~D12 중 어디이고 다음 게이트는 무엇인가

앞의 여덟은 계획이고 이것만 사실입니다. 둘이 갈리면 조가 모릅니다.

기록 · 진행 현황

아홉 가지는 조 저장소의 docs/PRD.md 한 곳에 모읍니다. 이 화면은 그 문서를 요약해 보여줄 뿐이고, 원본은 각 조 저장소입니다.

Delivery format

버티컬 Agent를 운영 가능한 서비스로 냅니다.

화면, Agent API, MCP 도구, 관측·평가를 한 실행 경로로 연결합니다. MCP는 제품 기능을 위한 도메인 도구이지, 공개 데모 API가 아닙니다.

01

Vercel UI

사용자 입력·결과·실패 안내

증거 · Vercel URL

02

Cloud Run API

GET /health · POST /api/agent

증거 · Cloud Run URL

03

MCP 도구

도메인 데이터·행동을 /mcp로 제공

증거 · 호출 결과

04

Evidence loop

Docker · Langfuse · Prompt Management · Evals 재측정

증거 · README · EVAL_REPORT

브라우저가 Cloud Run을 직접 호출한다면 CORS·인증·비밀값 노출 방식을 README에 설명하세요. `/api/agent`와 `/mcp`는 역할을 분리합니다.

Pre-planning

9/14~9/17 사전기획 과제부터 시작합니다.

문제 후보, 사용자 상황, 범위, 평가셋 후보를 개인별로 준비한 뒤 9/18에 조의 한 문장으로 합칩니다.

GitHub 조직 →

이 페이지는 요약입니다. 필수 조건의 정확한 판정 기준, 신뢰 경계와 인젝션 방어 요구, RAG 경계 사례 15종, 서비스 엔지니어링 5원칙, FAQ는 2차 프로젝트 가이드 v4 PDF에서 확인하세요.