Skip to content
Park Hyoin PARKHYO.IN
Go back

AI에게 검증을 맡기려다 공부하기로 했다

Edit page

개요

2주 전 좋은 회사로 입사를 하게 되어, AX 관련 정부 과제를 진행하고 있다. 임베디드 개발을 하던 나에겐 조금 빠른 템포로, 2달 만에 결과를 내야 하는 일정이라 적응하기 위해 몸부림 치고 있다.

그럼에도 불구하고, 나를 느리게 만드는 것들이 있다. 그 중 하나가 “검증”이다.

오늘 퇴근하면서도 동료 개발자분에게 얘기했다. “검증 지옥이네요..” AI가 정리한 문서에 대한 검증, AI가 짠 코드에 대한 검증. 분명 AI로 인해 구현하는 속도는 빨라졌지만, 그만큼 검증해야 하는 내용들은 쌓인다.

이 수많은 콘텐츠들을 어떻게 검증할 것인가?

Table of contents

Open Table of contents

검증을 위한 AI?

가장 먼저 든 생각은 검증을 전문적으로 하는 AI를 만들어야 하는가에 대한 생각이었다. 일단 관련 연구가 있는지 찾았다.

LLM-as-a-Judge

예전에 RAG 예제를 하면서 검증할 때 들어본 용어인 거 같다. 테스트에 대한 답을 RAG가 내놓을 때 정량적으로 얼마나 신뢰성 있는 대답을 했는지 확인할 때 썼었다. 실제로 이 패러다임(이라고 표현을 하더라)은 다양한 AI 시스템의 출력을 평가, 비교하는 데 활용된다고 한다. 단일 에이전트로 검증하는 방법이 있고 여러 에이전트가 토론하며 평가하는 방식으로 발전하고 있다고도 한다.

Critic 모델

OpenAI에 CriticGPT가 있다고 한다. 해당 논문은 2024년에 억셉된 거 같은데 내가 요즘 걱정하는 부분을 담고 있다. 모델이 똑똑해지면서 오히려 사람이 이 모델 출력의 정확성을 제대로 판단하지 못하는 지점이 오고 있다는 게 이 논문의 출발점이다. 어제 포럼에서 2년 전의 모델 성능과 비교해서 지금 모델 성능이 월등히 높아졌다는 얘기에 공감을 했는데 이미 2년 전부터 이런 고민을 하고 있었으니 지금은 그때보다 더 검증이 중요할 거란 생각이 든다.

결론적으로는 사람보다 CriticGPT, 프롬프트 개선한 ChatGPT가 훨씬 많은 버그를 탐지했다. 또한 모델 단독보다는 사람+CriticGPT 협업 팀이 할루시네이션 비율을 낮췄다고 한다. 그리고 CriticGPT가 강화학습한 분야가 코드 리뷰였는데 코드 리뷰가 아닌 분야에서도 비평적인 사고를 해서 사람은 완벽하다고 생각했던 답변의 등급을 낮췄고 그게 실제 있는 오류를 찾아낸 결과라고 했다.

이렇게만 보면 일도 AI한테 맡기고 그 검증도 AI한테 맡기면 되겠다 싶은데 당연히 한계점이 있다. CriticGPT도 역시 할루시네이션 문제가 있었고 사람보다 그 비율이 훨씬 높았다는 점. 문제의 난이도가 어려울수록 CriticGPT가 유의미하게 도움이 되지 않았다는 점도 있었다고 한다.

결국에 내가 드는 생각은 AI 검증을 위한 AI를 만들어놨더니 이 답변도 검증이 필요한 거 아닌가? 하는 생각이다. 분명 LLM의 환각 문제는 계속될 것이고 확률은 결국 나의 뒤통수를 때릴 것이다.

검증한다고 끝이 아니다.

혹여나 AI가 안 틀리고 모든 출력에 대한 검증을 할 수 있고 그게 사실이라고 가정하자. 그러면 사람이 할 일이 없을까? 요즘의 나는 더 확고하게 아니라고 생각한다.

AI가 발전할수록 인간은 더 많은 코드, 더 많은 문서에 둘러싸인다. 문제는 이렇게 뱉어낸 코드를 AI가 책임지는 게 아니라 인간이 책임져야 한다는 것이다. 여기서 말하는 책임을 다른 말로 하면 “이해” 또는 “검증”이라고 할 수 있을 것이다. 즉, AI가 검증한다고 한들 인간이 그 결과에 대해 이해하고 검증할 수 있어야 협업하는 동료에게, 서비스를 요청한 고객에게 설명할 수 있고 책임질 수 있게 된다고 생각한다.

이런 이유로 나는 검증을 위한 AI보다는 검증을 위한 학습을 해야한다는 결론에 이르렀다.

AI 시대의 학습

인간이 학습하는 시간보다 AI의 성장이 빠르다고들 한다. 어느 정도는 맞는 말이다. openai에서는 Astra가 나왔고 오늘은 Claude에서 Opus 5.5가 나왔다. 그렇다고 인간의 성장이 필요없는 것은 아니다.

인간은 이렇게 향상된 성능의 모델이 내놓는 출력을 검증할 수 있을 정도의 기반 지식이 있어야 한다고 생각한다. 도메인 지식, 코드 리뷰, 데이터 분석과 같은 일들은 수없이 쌓이는 문서들과 코드들 속에서 더욱 더 필요해지는 지식들이다. 프로젝트를 진행하면서 이런 개념들이 부족하면 AI가 내놓는 답변이 틀린지 맞는지를 알 수가 없다. 맞겠거니 하고 진행하다 보면 구덩이 앞까지 걸어가다가 “다시 찾아보니 앞은 구덩이네요. 제가 틀렸습니다!”라고 하는 AI를 보게 될 것이다. 그런 생산성 저하를 막기 위해 자신의 분야에 대해 학습하는 걸 게을리 하지 않아야 하고, 그런 검증에 대한 실력은 평생 꺼지지 않을 것이라고 생각하고 있다.

그래서 결론은…

수많은 인간을 대체할 정도로 AI의 성능은 좋아졌다. 좋아지는 성능을 감당하기 위해 AI를 빨리 경험해보고 뭔가를 만드는 것이 빨라보일 수 있지만 AI가 내는 결과를 검증하고 설명할 수 있는 실력을 갖추기 위해 학습하는 것이 느려보이지만 확실한 방법이라고 생각한다.


Edit page