Posts
All the articles I've posted.
-
FEMS 프로젝트 #2 — 실데이터 230페이지 코퍼스 + 청크 품질 게이트 + 로컬 LLM 의 한자 혼입 함정
한국BEMS협회 가이드 / 한국에너지공단 자료 / UCI Steel 데이터셋으로 약 230페이지 / 35,000행 코퍼스 확보. 문단 기반 청킹(target 800자) + bge-m3 + Chroma 인덱싱 후 품질 게이트(완성형 한글/ASCII 비율) 로 목차 페이지 7개 청크 제외. 그리고 만난 함정 — qwen2.5:7b 가 두번째 질문에서 한자 혼입 + 생성 붕괴 (관계없는 중국 도시 좌표를 GeoJSON 으로 뱉어냄). temperature / 시스템 프롬프트로 부분 해결 → 결국 exaone3.5:7.8b 로 교체해 깔끔 처리.
-
LangGraph 공부 #3 — Human-in-the-Loop (위험 도구 승인) · 체크포인트와 Interrupt 메커니즘
에이전트가 파일 삭제·이메일 발송·결제 같은 위험 도구를 자동으로 호출하면 사고난다. LangGraph 의 체크포인트 + Interrupt 메커니즘으로 위험 도구 직전에 사람의 승인을 받는 HITL 패턴 구현. 의외의 함정: LLM 자체 안전장치가 HITL 까지 도달을 막아버리는 케이스. 시스템 프롬프트와 HITL 게이트를 어떻게 분리해야 하는지.
-
FEMS 프로젝트 #1 — 저사양 로컬 (Ollama + bge-m3 + Chroma) vs Claude API RAG 비교 셋업
FEMS (Factory Energy Management System) 도메인을 학습하면서 RAG 프로토타입을 짜본다. GTX1660 Super · VRAM 6GB 의 저사양 환경에서 로컬 LLM(Ollama) 으로 추론하는 것과 Claude / OpenAI API 를 호출하는 것을 비교. 임베딩은 한국어 강한 bge-m3, 벡터 DB 는 Chroma. 콜드스타트 95초 → 워밍업 후 10초까지 줄어든 ollama, 정답률은 클라우드와 동등.
-
퀀트 공부 00 — pandas 기초 · 추세추종 vs 평균회귀 · 백테스트 4대 편향 · 가짜 알파
퀀트 학습 시리즈 시작. pandas Series/DataFrame, loc/iloc, 워밍업 구간(NaN), 수정주가로 인한 조용한 데이터 오염, 추세추종(MA·골든/데드 크로스) vs 평균회귀, 백테스트의 4대 편향(미래참조·과최적화·비현실적 거래비용·생존편향), 그리고 한 점이 아니라 분포로 봐야 가짜 알파를 거른다 (B&H 초과 비율 / Alpha 중앙값 / 노출시간 / 워크포워드).