Posts
All the articles I've posted.
-
Eval 공부 #1 — '느낌 벤치마킹' 을 끝낼 때 · 정확도 기반 + LLM-as-Judge 첫 구현
여태 프로젝트마다 '빠른 거 같다', '정확한 것 같다' 식 느낌 평가만 해왔는데, 이제 진짜로 수치화하는 Eval 공부 시작. Eval 의 4가지 종류(정확도 / 유사도 / LLM-as-Judge / 사람 평가) 정리 + 도구 선택 정확도 10/10 측정 + LLM-as-Judge 로 같은 질문에 대한 두 답변을 8/10 vs 3/10 으로 채점. LLM-as-Judge 의 한계(평가자 변동성, 같은 모델 답변 후한 점수)까지.
-
MCP 공부 #3 — Resources / Prompts 의 정체 + LangGraph 와 통합 (`MultiServerMCPClient` · `ainvoke`)
MCP 의 세 구성요소 중 #1 / #2 에서 다룬 Tools 외에 Resources(LLM 이 읽을 데이터, 백그라운드 컨텍스트, 읽기 전용) 와 Prompts(미리 정의된 템플릿) 까지. Inspector + Claude Desktop 으로 새 서버 확인 → langchain-mcp-adapters 로 MCP 서버를 LangGraph 에 통합. MCP 통신이 비동기라 `ainvoke` 필요한 이유, MultiServerMCPClient 가 서버 그대로 불러오는 비결(=MCP 표준 준수), Resources 를 시스템 프롬프트로 주입했을 때의 도메인 응답 품질 차이까지.
-
MCP 공부 #2 — Claude Desktop 에 내가 만든 MCP 서버 붙이기 · 도구 호출 + 승인 UX
어제 만든 energy-management MCP 서버를 Claude Desktop 에 실제로 연결. claude_desktop_config.json 찾는 법(설정 → 개발자 → 구성 편집) → 서버 등록 → 재시작 → 커넥터 메뉴에서 확인 → '공장 라인 목록 보여줘' 질문에 Claude 가 도구 호출 + '항상 허용/거부' 승인 UX 까지. 의문 — RAG 와 MCP 를 같이 쓰는 방법은? (답: RAG 를 MCP 서버로 감싸면 됨)
-
FEMS 프로젝트 #3 — Streamlit 비교 대시보드 + 3-백엔드 질문 평가 (Claude 9 / exaone 7 / gpt 7)
FEMS RAG 위에 Streamlit 대시보드 얹어서 동일 질문을 3-백엔드 (exaone3.5:7.8b / claude-opus-4-8 / gpt-4o) 에 동시에 던지고 비교. Q1 (에어 컴프레셔 5월 이상) — exaone·gpt 는 '자료 없음', Claude 는 raw 데이터 없이도 요약치만으로 '주말 시간대 이상' 추론 + 한계 고지. Q2 (관리자 관점 절약 방안) — Claude 9/10 (토큰 절단으로 미완), exaone 7/10 (인덱스 깨짐), gpt 7/10 (간결하지만 '커패시터' 환각). 5축 채점 결과.