Tag: rag
All the articles with the tag "rag".
-
Eval 공부 #1 — '느낌 벤치마킹' 을 끝낼 때 · 정확도 기반 + LLM-as-Judge 첫 구현
여태 프로젝트마다 '빠른 거 같다', '정확한 것 같다' 식 느낌 평가만 해왔는데, 이제 진짜로 수치화하는 Eval 공부 시작. Eval 의 4가지 종류(정확도 / 유사도 / LLM-as-Judge / 사람 평가) 정리 + 도구 선택 정확도 10/10 측정 + LLM-as-Judge 로 같은 질문에 대한 두 답변을 8/10 vs 3/10 으로 채점. LLM-as-Judge 의 한계(평가자 변동성, 같은 모델 답변 후한 점수)까지.
-
FEMS 프로젝트 #3 — Streamlit 비교 대시보드 + 3-백엔드 질문 평가 (Claude 9 / exaone 7 / gpt 7)
FEMS RAG 위에 Streamlit 대시보드 얹어서 동일 질문을 3-백엔드 (exaone3.5:7.8b / claude-opus-4-8 / gpt-4o) 에 동시에 던지고 비교. Q1 (에어 컴프레셔 5월 이상) — exaone·gpt 는 '자료 없음', Claude 는 raw 데이터 없이도 요약치만으로 '주말 시간대 이상' 추론 + 한계 고지. Q2 (관리자 관점 절약 방안) — Claude 9/10 (토큰 절단으로 미완), exaone 7/10 (인덱스 깨짐), gpt 7/10 (간결하지만 '커패시터' 환각). 5축 채점 결과.
-
RAG 데이터 준비의 전체 흐름 — 선정 · 클렌징 · 청킹 · 메타데이터 · 평가셋
FEMS 프로젝트를 진행하다가 '벡터 DB 에 뭘 어떻게 넣어야 하는가' 가 궁금해서 정리. 핵심 깨달음 — 데이터는 '도메인' 기준이 아니라 '검색되어야 할 질문' 기준으로 거꾸로 선정한다. 그 외 클렌징 / 청크 앞 메타데이터(문서 제목·섹션 경로) 의 효과 / 아날로그 데이터 OCR 전처리 / 평가셋 구축까지 RAG 데이터 파이프라인 전체 흐름.
-
FEMS 프로젝트 #2 — 실데이터 230페이지 코퍼스 + 청크 품질 게이트 + 로컬 LLM 의 한자 혼입 함정
한국BEMS협회 가이드 / 한국에너지공단 자료 / UCI Steel 데이터셋으로 약 230페이지 / 35,000행 코퍼스 확보. 문단 기반 청킹(target 800자) + bge-m3 + Chroma 인덱싱 후 품질 게이트(완성형 한글/ASCII 비율) 로 목차 페이지 7개 청크 제외. 그리고 만난 함정 — qwen2.5:7b 가 두번째 질문에서 한자 혼입 + 생성 붕괴 (관계없는 중국 도시 좌표를 GeoJSON 으로 뱉어냄). temperature / 시스템 프롬프트로 부분 해결 → 결국 exaone3.5:7.8b 로 교체해 깔끔 처리.