인공지능/딥러닝
[LLM] - ChatGPT 뜻...
Ch's Lee
2025. 11. 29. 21:07

그 안에 파인 튜닝이라는 개념이 존재합니다.
파인 튜닝 - 사전 학습된 모델을 특정 목적을 위해서 추가 학슶하는 것
- 추가 학습하거나
- 전체 파리미터를 미세 조정
파라미터 또는 매개변수는 가중치와 편향... 이며,

여러 오픈 소스가 존재
임베딩 과정 : 문서나 텍스트를 백터화 하는
"은행 몇시에 열어요"
밑에는 메뉴얼 적인 부분
1. 코퍼스 수집 (Raw Data)
"은행은 몇 시에 열어요? 대부분의 은행은 오전 9시에 엽니다."
2. 데이터 정제 (Cleaning)
- 불필요한 공백 제거
- HTML 태그 제거
- 특수문자 처리
→ "은행은 몇 시에 열어요? 대부분의 은행은 오전 9시에 엽니다."
3. 청킹 (Chunking) ← 필요시만
청크1: "은행은 몇 시에 열어요?"
청크2: "대부분의 은행은 오전 9시에 엽니다."
언제 필요? RAG, 문서검색, 긴 텍스트 처리 시
4. 토큰화 (Tokenization)
["은행", "##은", "몇", "시", "##에", "열", "##어요", "?"]
5. 정수 인코딩 (Integer Encoding)
["은행":1523, "##은":45, "몇":892, "시":334, ...]
→ [1523, 45, 892, 334, ...]
토큰을 숫자 ID로 변환
6. 벡터화/임베딩 (Embedding)
1523 → [0.2, -0.5, 0.8, ..., 0.3] # 512차원
45 → [0.1, -0.3, 0.7, ..., 0.4]
7. 모델 입력
신경망 층 통과 → 학습/추론
🎯 용도별 순서 요약:
LLM 학습/파인튜닝:
코퍼스 → 정제 → 토큰화 → 정수인코딩 → 임베딩 → 모델학습
RAG 시스템:
코퍼스 → 정제 → 청킹 → 토큰화 → 임베딩 → 벡터DB저장 → 검색
핵심: 청킹은 선택사항, 정수인코딩 단계가 빠져있었네요!
최종 백터 DB에 저장되어 검색 및 검증에 활용