Multilingual AI Data · Intermediate

다국어 AI 데이터 구축 중급 과정

코딩 없이 다국어 AI 데이터 1,000개를 계획·생성·검수·설명하는 10일 누적 프로젝트. 1일차 산출물이 다음 날의 입력이 되고, 9~10일차에 하나의 데이터셋으로 통합됩니다. 아래 6개 과정을 순서대로 따라가세요.

6개 과정 · 10일차 약 75시간 데이터 1,000개 2개 이상 언어 · 도메인 특화
과정 01

AI 학습용 데이터 구축 방법

컴퓨터·파일 기초부터 신경망에서 LLM까지, 프롬프트 8요소와 표→JSONL 변환까지. 코딩 없이 AI 데이터 프로젝트를 시작하는 공통 기반을 만듭니다.

DAY 01 · 8시간

여행 안내 QA 데이터 만들기

신경망에서 LLM까지 + 프롬프트 엔지니어링 + 기초 실습
8h

AI 서비스 환경을 갖추고 “AI 데이터는 행동 예시”라는 관점을 이해합니다. 프롬프트 8요소로 v0을 작성하고, 표를 JSONL로 직접·AI로 변환하며 프로젝트 폴더와 첫 로그를 만듭니다.

AI 첫 대화 8요소 프롬프트 v0 표→JSONL 도메인 후보 2개
실습 시작
과정 02

AI 학습용 데이터 프로젝트 관리

PM의 시각에서 범위·일정·품질·리스크를 통합 관리합니다. 1일차의 도메인 구상을 실행 가능한 팀 계획으로 전환합니다.

DAY 02 · 8시간

팀의 지도와 안전장치 만들기

AI 데이터 프로젝트 PM과 구축 계획
8h

프로젝트 차터로 목표·범위를 합의하고 WBS·역할표로 업무를 나눕니다. 개인정보·허위정보·저작권·번역투 같은 위험을 리스크표로 선제 관리합니다.

차터 v1 WBS 6단계+ 역할표 리스크 4개+
실습 시작
과정 03

다국어 AI 데이터 구축 실무

의도·라벨·스키마를 설계하고, 여러 작업자가 같은 기준으로 판단할 수 있는 라벨링 체계를 만듭니다. JSONL 필드 구조와 작업가이드가 이후 생성·검수의 공통 기준이 됩니다.

DAY 03 · 8시간

좋은 자료는 기준에서 시작한다

데이터 설계와 운영 방식 결정
8h

사용자 의도 라벨과 10개 이상의 필드로 JSONL 스키마를 정의합니다. Seed·합성·평가·최종 데이터의 생성 담당과 검수 방식을 운영 방식표로 결정합니다.

의도 라벨 6개+ 필드 10개+ 포함·제외 범위
실습 열기
DAY 06 · 8시간

같은 기준으로 라벨을 붙이고 판정하기

라벨링 준비와 작업가이드
8h

라벨 정의와 오류 태그를 표준화하고 pass·caution·fail 판정 기준을 정합니다. 좋은 예·나쁜 예·예외·검수 기준을 담은 작업가이드 v1을 완성합니다.

라벨 5개+ 오류 태그 5개+ 좋은/나쁜 예 작업가이드 v1
실습 열기
과정 04

AI 학습용 데이터 수집 및 정제 실무

데이터를 어디서·어떤 조건으로 쓸지 정하고 출처와 사실성을 추적합니다. 저장 스키마·정제 규칙·placeholder를 적용해 합성데이터의 기준이 될 Seed 40건을 완성합니다.

DAY 04 · 8시간

믿을 수 있는 데이터 만들기

데이터 수집과 사실성 확보
8h

수집원별 장단점과 저작권·최신성 위험을 비교하고 출처 관리표를 만듭니다. 미확인 날짜·가격·정책을 단정하지 않도록 위험 문장을 고치고 사실성 검수 프롬프트를 작성합니다.

수집원 3개+ 출처 관리표 사실성 검수
실습 열기
DAY 05 · 8시간

좋은 데이터 한 줄을 안전하게 만드는 법

저장·정제와 Seed 데이터
8h

JSONL/CSV 저장 구조와 UTF-8 다국어 원칙을 익히고 정제 규칙을 적용합니다. 실제 개인정보를 placeholder로 바꾸고, 언어 균형을 맞춰 Seed 데이터 40건을 작성합니다.

저장 스키마 정제 규칙 6개+ Seed 40건
실습 열기
과정 05

다국어 AI 데이터 품질 관리 실무

파일럿 라벨링·상호/역번역 검수·샘플 검수와 프롬프트 개선을 거쳐 합성데이터, A/B 응답 평가셋, 품질관리 리포트 초안을 만듭니다.

DAY 07 · 8시간

작은 데이터로 파일럿 라벨링·검수·일치율 운영하기

라벨링과 검수 운영
8h

소규모 파일럿으로 기준의 모호함을 찾고 라벨러 간 일치율을 계산합니다. 상호 검수와 모르는 언어의 역번역·교차 AI 검수로 수정·재생성·삭제 재작업 기준을 만듭니다.

파일럿 10건 일치율 역번역 검수 재작업 기준
실습 열기
DAY 08 · 8시간

AI 초안을 안전한 데이터로

합성데이터 · 응답 평가셋 · 품질관리
8h

Seed를 기준으로 20건 배치 단위로 약 300건을 생성하고, 무작위 샘플 50건 이상을 검수해 프롬프트를 개선합니다. A/B 응답 평가셋 30세트와 오류 Top 5를 담은 품질 리포트 초안을 만듭니다.

합성 ~300건 A/B 30세트+ 샘플 검수 50+ 품질 리포트
실습 열기
과정 06

도메인 특화 다국어 AI 데이터 실습

1일차부터 누적한 모든 산출물을 하나의 데이터셋으로 통합합니다. 데이터 1,000개와 문서화를 완성하고, 발표·질의응답·피드백·회고를 거쳐 최종 제출합니다.

DAY 09 · 5시간

최종 제출 패키지 만들기

최종 프로젝트 통합 1 · 1,000개 완성
5h

Seed 40 + 합성 860 + A/B 100세트를 목표로 부족분을 채우고 언어×의도 분포를 점검합니다. 숫자보다 검수된 품질을 우선하며 품질 리포트·데이터셋 카드·발표 자료 1차본을 완성합니다.

데이터 1,000개 폴더 정리 데이터셋 카드 발표 1차본
실습 열기
DAY 10 · 5시간

최종 발표·동료 피드백·책임 있는 제출

최종 프로젝트 통합 2 · 발표
5h

발표 자료를 최종 수정하고 데이터·문서·폴더의 제출 상태를 확인합니다. 팀별 발표와 질의응답, 동료·강사 피드백을 반영해 최종본을 제출하고 개인 회고로 10일을 정리합니다.

발표 최종본 질의응답 개인 회고 최종 제출
실습 열기
프로젝트

K-컬처 팀 데이터셋 프로젝트

프로젝트 관리 가이드

K-컬처 데이터셋 프로젝트 샘플

K-CULTURE SAMPLE DATA
9day

2~8일차는 강의 실습을 프로젝트 관리 도구에 바로 반영하고, 9일차 5시간에는 1,000건을 마무리하며, 10일차 5시간에는 발표와 최종 제출을 진행합니다.

K-컬처 샘플 프로젝트 가이드
실습 열기
프로젝트 관리

K-컬처 데이터셋 프로젝트 제작

K-CULTURE DATA 팀 데이터셋 만들기
9day

2~8일차에는 팀이 데이터를 만들고 합칩니다. 9일차에는 최대 1,000건까지 확장하고, 10일차에는 품질 근거가 담긴 12장 발표 자료와 최종 ZIP을 만듭니다.

K-컬처 프로젝트 데이터셋 제작
실습 열기