코딩 없이 다국어 AI 데이터 1,000개를 계획·생성·검수·설명하는 10일 누적 프로젝트. 1일차 산출물이 다음 날의 입력이 되고, 9~10일차에 하나의 데이터셋으로 통합됩니다. 아래 6개 과정을 순서대로 따라가세요.
컴퓨터·파일 기초부터 신경망에서 LLM까지, 프롬프트 8요소와 표→JSONL 변환까지. 코딩 없이 AI 데이터 프로젝트를 시작하는 공통 기반을 만듭니다.
PM의 시각에서 범위·일정·품질·리스크를 통합 관리합니다. 1일차의 도메인 구상을 실행 가능한 팀 계획으로 전환합니다.
의도·라벨·스키마를 설계하고, 여러 작업자가 같은 기준으로 판단할 수 있는 라벨링 체계를 만듭니다. JSONL 필드 구조와 작업가이드가 이후 생성·검수의 공통 기준이 됩니다.
사용자 의도 라벨과 10개 이상의 필드로 JSONL 스키마를 정의합니다. Seed·합성·평가·최종 데이터의 생성 담당과 검수 방식을 운영 방식표로 결정합니다.
실습 열기 →라벨 정의와 오류 태그를 표준화하고 pass·caution·fail 판정 기준을 정합니다. 좋은 예·나쁜 예·예외·검수 기준을 담은 작업가이드 v1을 완성합니다.
실습 열기 →데이터를 어디서·어떤 조건으로 쓸지 정하고 출처와 사실성을 추적합니다. 저장 스키마·정제 규칙·placeholder를 적용해 합성데이터의 기준이 될 Seed 40건을 완성합니다.
수집원별 장단점과 저작권·최신성 위험을 비교하고 출처 관리표를 만듭니다. 미확인 날짜·가격·정책을 단정하지 않도록 위험 문장을 고치고 사실성 검수 프롬프트를 작성합니다.
실습 열기 →JSONL/CSV 저장 구조와 UTF-8 다국어 원칙을 익히고 정제 규칙을 적용합니다. 실제 개인정보를 placeholder로 바꾸고, 언어 균형을 맞춰 Seed 데이터 40건을 작성합니다.
실습 열기 →파일럿 라벨링·상호/역번역 검수·샘플 검수와 프롬프트 개선을 거쳐 합성데이터, A/B 응답 평가셋, 품질관리 리포트 초안을 만듭니다.
소규모 파일럿으로 기준의 모호함을 찾고 라벨러 간 일치율을 계산합니다. 상호 검수와 모르는 언어의 역번역·교차 AI 검수로 수정·재생성·삭제 재작업 기준을 만듭니다.
실습 열기 →Seed를 기준으로 20건 배치 단위로 약 300건을 생성하고, 무작위 샘플 50건 이상을 검수해 프롬프트를 개선합니다. A/B 응답 평가셋 30세트와 오류 Top 5를 담은 품질 리포트 초안을 만듭니다.
실습 열기 →1일차부터 누적한 모든 산출물을 하나의 데이터셋으로 통합합니다. 데이터 1,000개와 문서화를 완성하고, 발표·질의응답·피드백·회고를 거쳐 최종 제출합니다.
Seed 40 + 합성 860 + A/B 100세트를 목표로 부족분을 채우고 언어×의도 분포를 점검합니다. 숫자보다 검수된 품질을 우선하며 품질 리포트·데이터셋 카드·발표 자료 1차본을 완성합니다.
실습 열기 →발표 자료를 최종 수정하고 데이터·문서·폴더의 제출 상태를 확인합니다. 팀별 발표와 질의응답, 동료·강사 피드백을 반영해 최종본을 제출하고 개인 회고로 10일을 정리합니다.
실습 열기 →
2~8일차는 강의 실습을 프로젝트 관리 도구에 바로 반영하고, 9일차 5시간에는 1,000건을 마무리하며, 10일차 5시간에는 발표와 최종 제출을 진행합니다.
실습 열기 →2~8일차에는 팀이 데이터를 만들고 합칩니다. 9일차에는 최대 1,000건까지 확장하고, 10일차에는 품질 근거가 담긴 12장 발표 자료와 최종 ZIP을 만듭니다.
실습 열기 →