Tag: rag
All the articles with the tag "rag".
-
RAG 임베딩 비교 — 내 블로그 데이터로 recall@k 측정 (OpenAI vs bge-m3)
[퀀트 회고에서 '느낌 벤치마킹 → 수치 벤치마킹' 원칙](/posts/quant-study-00-pandas) 을 세운 뒤, 이번엔 임베딩 모델 비교를 실제로 수치화. 내 블로그 글 441청크에 OpenAI text-embedding-3-small 과 bge-m3 를 각각 인덱싱하고, 20개 질문·정답 출처 테스트셋으로 recall@3 을 측정. 전체 OpenAI 80% vs bge-m3 90%. hard 난이도에서 bge-m3 가 100% — 단어 안 겹쳐도 의미로 원문과 연결한 케이스가 결정적. easy 에서 놓친 원인은 오타(cladue, 언더스코어)라 채점 기준 자체가 틀렸다는 반전.
-
Eval 공부 #2 — 유사도 기반 평가의 함정 · 테스트셋 5원칙 · '회귀테스트' 라는 용어 오해
Eval 두 번째 시간. 유사도 기반 평가 (임베딩 코사인) 를 직접 돌려봤더니 예상 못 한 결과 — OpenAI text-embedding-3-small 과 bge-m3 둘 다 '틀린 답' 에 가장 높은 점수를 매김. 유사도는 내용이 아니라 주제·표현 근접성을 잡기 때문. 마크다운 형식 차이만으로도 유사도가 크게 흔들림. 실전에선 유사도 + LLM-as-Judge 병행이 표준. 그리고 테스트셋 설계 5원칙 + '회귀테스트가 아니라 개선 검증(A/B)' 이라는 용어 정정.
-
Eval 공부 #1 — '느낌 벤치마킹' 을 끝낼 때 · 정확도 기반 + LLM-as-Judge 첫 구현
여태 프로젝트마다 '빠른 거 같다', '정확한 것 같다' 식 느낌 평가만 해왔는데, 이제 진짜로 수치화하는 Eval 공부 시작. Eval 의 4가지 종류(정확도 / 유사도 / LLM-as-Judge / 사람 평가) 정리 + 도구 선택 정확도 10/10 측정 + LLM-as-Judge 로 같은 질문에 대한 두 답변을 8/10 vs 3/10 으로 채점. LLM-as-Judge 의 한계(평가자 변동성, 같은 모델 답변 후한 점수)까지.
-
FEMS 프로젝트 #3 — Streamlit 비교 대시보드 + 3-백엔드 질문 평가 (Claude 9 / exaone 7 / gpt 7)
FEMS RAG 위에 Streamlit 대시보드 얹어서 동일 질문을 3-백엔드 (exaone3.5:7.8b / claude-opus-4-8 / gpt-4o) 에 동시에 던지고 비교. Q1 (에어 컴프레셔 5월 이상) — exaone·gpt 는 '자료 없음', Claude 는 raw 데이터 없이도 요약치만으로 '주말 시간대 이상' 추론 + 한계 고지. Q2 (관리자 관점 절약 방안) — Claude 9/10 (토큰 절단으로 미완), exaone 7/10 (인덱스 깨짐), gpt 7/10 (간결하지만 '커패시터' 환각). 5축 채점 결과.