Loading the catalog…
Loading the catalog…
개인 프로젝트 챗봇이 한 말을 얼마나 믿을 수 있을까 오늘 작업은 챗봇이 한 답변을 사용자가 얼마나 믿을 수 있게 만들 것인지 를 계속 확인하는 데 가까웠다. 근거 표시를 다시 다듬고, AI가 했던 채점을 사람이 직접 확인하고, 역할 대화에서 생기는 말투와 시점 문제를 수정한 뒤 실록 청크에 쉬운 말 풀이를 붙이는 작업까지 진행했다. 답변마다 근거의 성격 표시하기 현재 만들고 있는 챗봇에서 등장할 역사적 인물의 답변에는 실제 실록에 기록된 사실도 있지만, 실록을 바탕으로 풀어 설명한 부분이나 당시 인물의 입장에서 말하는 표현도 섞일 수 있다. 그래서 근거 표시 시 구분을 해주기 위해 답변의 문장마다 성격을 나누어 표시하도록 했다. 실록 기록 : 실록에 직접 기록된 내용 실록 풀이 : 실록 내용을 현대적으로 풀어 설명한 내용 인물 시점 : 해당 인물이 그 시점에 알 수 있는 범위에서 한 말 AI 창작 : 연출을 위해 추가된 표현 처음에는 해석 이라는 표현을 사용했지만 조금 애매하게 느껴져 실록 풀이 로 바꾸었다. 표본을 다시 확인하면서 근거 표시 방식도 수정했고, 표시 정확도는 기존 82%에서 99%까지 올라갔다. 단순히 답변 아래에 출처 링크를 붙이는 것보다 어느 부분이 실제 기록이고 어느 부분이 AI가 풀어쓴 내용인지 구분해서 보여주는 것 이 학습용 서비스에서는 더 중요하다고 생각했다. AI가 만든 채점도 사람이 다시 확인하기 어느새 한 주가 끝나는 금요일이라 강사님께서 중간 점검을 제출해 달라고 하셨다. 그런데 자료를 정리하다 보니 한 가지 문제가 눈에 들어왔다. 평가셋의 정답 기준도 AI와 함께 만들었는데, 결과 채점 역시 AI에게 맡기고 있었다. 결국 AI 가 만든 결과를 AI가 다시 평가하고 있는 셈이었다. 그래서 AI의 기존 판정을 보지 않은 상태에서 답변 30개를 내가 다시 채점해보았다. 처음 나와 AI 의 정답 판정이 일치한 것은 19/30 이었다. 차이가 나는 문항들을 하나씩 확인하면서 다른 시대의 함정 질문은 자료에 없다고 답해도 정답 질문한 장면과 다른 시점의 이야기로 답하면 오답 맞는 질문인데 첫 문장에서 부정하면 부분 점수 처럼 채점 기준도 더 구체적으로 정리했다. AI 채점기가 사람보다 지나치게 엄격하게 판단한 경우도 있었고, 반대로 내가 너무 엄격하게 봤던 기준도 있었다. 그래서 서로 다른 판정을 하나씩 비교하면서 기준을 다시 정리했다. 진작 한 번 확인했어야 했다는 생각도 들었지만, 이런 의미에서 중간 점검을 적절한 시기에 한 번 거친 것이 다행이었다. 규칙 하나를 고치면 다른 문제가 생긴다 직접 결과를 검토하다 보니 역할 대화에서 반복되는 말투 문제도 발견했다. 틀린 전제를 바로잡으라는 규칙 때문에 답변이 계속 "아니다." 로 시작하는 버릇이 있었는데, 프롬프트에서 예시를 주며 규칙 문장을 조금 더 자연스럽게 수정하자 이 문제는 사라졌다. 또 당시에는 아직 사용되지 않던 후대의 호칭을 사용하는 경우도 있었는데 실록 자체가 나중 시점의 표현을 포함하고 있기 때문에 생긴 문제였고, 역할 대화에서는 당시 인물이 실제로 사용할 수 있는 호칭만 사용하도록 다시 제한했다. 그런데 규칙을 고친 뒤 전체 평가를 다시 돌리자 새로운 부작용도 나타났다. 틀린 전제를 고치는 규칙이 너무 강하게 적용되어, 정상적인 질문에도 질문에 없는 대조 표현을 만들어내는 경우가 생겼다. 그래서 다시 전제가 맞으면 불필요하게 부정하거나 비교하지 않고 바로 답한다 는 규칙을 추가했고, 전체 평가를 다시 진행했다. 이 과정을 보면서 몇 개의 예시만 보고 수정이 잘 됐다고 판단하면 안 되고, 규칙을 바꿀 때마다 전체 평가셋으로 다시 확인해야 한다 는 점을 느꼈다. 검색을 사용하는 ChatGPT와 비교하기 이후 중간 점검을 제출하고 나니 강사님의 피드백을 받게 되었다. 제출한 내용 중 범용 AI와 현재 만든 RAG 챗봇의 평가 결과를 비교한 표가 있었는데 GPT 가 웹 검색을 사용할 경우 단순 사실 확인에서는 거의 대부분 정답을 맞혔었고 단순한 정답률만으로는 프로젝트의 특장점을 보여주기 어려워 보였다. 반면 역사 인물 역할 대화에서는 아직 해당 인물이 알 수 없는 미래의 정보를 말하는 경우가 있었고, 현재 프로젝트에서는 지금까지 이 미래 정보 누설을 0으로 유지 하고 있다. 그래서 프로젝트의 장점을 단순히 ChatGPT보다 정확하다 라고 주장하기보다는, 실제 비교에서 차이가 확인된 시점 제한과 근거 확인 기능 을 중심으로 보여주는 쪽이 맞다고 판단했다. 실록 용어를 쉬운 말로 찾을 수 있게 만들기 마지막으로 강사님 조언을 받아 실록 청크마다 쉬운 말 풀이도 추가하기 시작했다. 예를 들어 사용자는 어떤 기관을 정확한 역사 용어로 기억하지 못하고 "세조 때 불교 책을 찍던 기관" 처럼 질문할 수 있다. 하지만 실록에는 정확한 역사 용어만 들어 있기 때문에 표현이 너무 다르면 검색에서 놓칠 수 있다. 그래서 질문을 미리 정해둔 단어로 바꾸는 방식보다는 실록 청크 자체에 쉬운 말 풀이를 추가하는 방향 으로 잡았다. 원래 번역문에는 역사 용어를 그대로 유지하고, 별도의 풀이에는 해당 용어가 무엇을 의미하는지 현대적인 표현을 붙인다. 이렇게 하면 검색할 때는 쉬운 표현도 활용할 수 있고, 화면에서는 사용자가 모르는 역사 용어를 눌러 설명을 확인하는 기능으로도 사용할 수 있다. 현재 803개의 청크를 확인해 그중 722개에 쉬운 말 풀이를 추가했고, 다음에는 이 풀이가 실제 검색 성능에 도움이 되는지 확인할 예정이다. 마무리 오늘은 눈에 띄는 새로운 화면이나 기능을 많이 만든 날은 아니었다. 대신 답변의 근거가 맞는가 → 채점 기준이 맞는가 → 역할 대화의 표현이 시대에 맞는가 → 규칙을 바꾼 뒤 다른 오류가 생기지 않았는가 를 계속 확인했다. 프로젝트가 진행될수록 단순히 정답률 하나만 높이는 것보다 왜 이 답을 믿을 수 있는지 설명할 수 있게 만드는 과정 이 더 중요하게 느껴진다. 다음에는 오늘 추가한 쉬운 말 풀이가 실제 검색 결과를 개선하는지 확인하고, 효과가 있다면 Embedding과 화면의 용어 주석 기능까지 연결해볼 예정이다.
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
2026.10.02 Day 36 [NC AI] 커스텀 AI 서비스 개발자 양성과정. 개인 프로젝트 챗봇이 한 말을 얼마나 믿을 수 있을까 오늘 작업은 챗봇이 한 답변을 사용자가 얼마나 믿을 수 있게 만들 것인지 를 계속 확인하는 데 가까웠다. 근거 표시를 다시 다듬고, AI가 했던 채점을 사람이 직접 확인하고, 역할 대화에서 생기는 말투와 시점 문제를 수정한 뒤 실록 청크에 쉬운 말 풀이를 붙이는 작업까지 진행했다. 답변마다 근거의 성격 표시하기 현재 만들고 있는 챗봇에서 등장할 역사적 인물의 답변에는 실제 실록에 기록된 사실도 있지만, 실록을 바탕으로 풀어 설명한 부분이나 당시 인물의 입장에서 말하는 표현도 섞일 수 있다. 그래서 근거 표시 시 구분을 해주기 위해 답변의 문장마다 성격을 나누어 표시하도록…
Open source