9일차는 데이터를 새로 많이 만드는 날이 아니라, 지금까지 만든 자료를 제출 가능한 패키지로 잠그는 마감 수업입니다. 먼저 수량·분포를 점검해 오늘 채울 부족 칸을 고르고, 안전 조건을 넣어 20건 배치로 부족분만 보완합니다. 이어 AI 자기검수 → 사람 샘플 검수 → 오류 유형 정리 → 수정·재생성·폐기로 데이터를 책임 있게 다듬고, 통과한 데이터만 final_qa_dataset.jsonl로 병합합니다. 마지막으로 A/B 응답 평가셋, 데이터셋 카드·품질 리포트, 발표 초안까지 만들고 제출 상태를 확인합니다. 핵심 문장은 하나입니다 — 많이 만드는 것보다, 안전하게 만들고 설명할 수 있는 것이 더 중요하다. 각 카드의 복사 버튼으로 템플릿을 가져가 팀 문서에 붙여넣고 채우세요.
final_qa_dataset.jsonl 완성확인 필요라고 적습니다.final_qa_dataset.jsonl · 검수를 통과한 QA 데이터를 병합한 최종 데이터셋final_eval_pairs.jsonl · 질문 1개 + 답변 2개의 A/B 응답 평가셋17_quality_report.md · 검수 결과·오류 Top 5·수정 예시·남은 한계·개선 계획18_dataset_card.md · 목적·대상·언어·구성·생성·검수·한계·사용 금지 사례19_final_presentation.md · 문제·구성·검수·오류 Top·한계를 담은 10장 발표 초안00_project_log.md · 오늘 결정·작업·수정·폐기·남은 일을 시간순으로 기록먼저 오늘 수업의 위치와 5시간 운영 지도를 정하고, 핵심 용어를 행동으로 바꿉니다. 그다음 팀 폴더와 파일 이름을 제출형으로 통일하고, 생성·검수·기록 역할과 25분 단위 작업 리듬을 정합니다. 새 주제를 벌리지 않고 제출 가능한 상태로 정리하는 것이 기준입니다.
최종 수량 점검표로 Seed·합성·평가셋의 목표·현재·부족분을 한 표에 모읍니다. 언어 × 의도(intent) 교차표로 빈 칸·부족 칸·몰린 칸을 찾고, 오늘 먼저 채울 language × intent 조합을 우선순위로 고릅니다. 많이가 아니라 균형을 봅니다.
생성 프롬프트에 안전 울타리(개인정보 금지·단정 금지·확인 필요)를 먼저 넣고, 20건 배치로 부족분만 작게 만듭니다. AI 자기검수로 1차 오류를 훑은 뒤 사람 샘플 검수로 책임 있게 확인하고, 오류에 이름(태그)을 붙여 모은 다음 수정·재생성·폐기를 판단합니다. 위험 데이터는 망설이면 제외합니다.
검수를 통과한 파일만 골라 최종 QA 데이터로 병합합니다. 필드 이름과 순서를 통일하고 QA 데이터와 평가셋을 분리하며, 중복 id·유사 질문을 정리한 뒤 파일명·줄 수·필수 필드·위험 정보 없음·검수 로그를 제출 기준으로 확인해 final_qa_dataset.jsonl을 잠급니다.
응답 평가셋은 좋은 답을 고르는 연습장입니다. 질문 1개에 답변 2개(A/B)를 두고 preferred와 reason을 기록하며, intent 범위를 정해 20세트씩 만듭니다. ‘B가 더 좋다’ 대신 안전·정확·구체 근거로 reason을 쓰고, 사람 검토로 의견이 갈린 항목을 맞춘 뒤 고친 줄만 final_eval_pairs.jsonl에 저장합니다.
데이터셋 카드는 데이터 상자에 붙이는 설명서이고, 품질 리포트는 검사 결과와 수정 기록입니다. 카드에 목적·대상·언어·구성·생성·검수·한계·사용 금지 사례를 채우고, 리포트에 오류 Top·수정 예시·남은 한계·개선 계획을 담습니다. 프로젝트 로그로 오늘의 증거를 남기고 10장 발표 초안을 만든 뒤, 6개 파일의 제출 상태를 확인합니다.
여섯 파일이 모두 준비됐는지 마지막으로 확인합니다. 아래 항목을 모두 체크한 뒤 저장하세요. 남은 빈칸은 00_project_log.md의 ‘남은 질문’으로 옮깁니다.