Loading the catalog…
Loading the catalog…
AI Meeting Note의 기본 회의록에는 결정사항과 할 일이 나뉘어 있다. 프롬프트 v2를 평가했을 때, 같은 약속이 양쪽에 반복되거나 하나의 일을 여러 항목으로 나누는 문제가 관찰됐다. 이를 줄이려고 v2.1을 만들었다. 그런데 평가 결과는 한 방향으로 움직이지 않았다. 기존 평균 F1은 내려갔고, 추가 항목을 엄격하게 보는 F1은 올라갔다. 기본 프롬프트를 정하려면 점수가 무엇을 세고 있는지부터 확인해야 했다. F1은 무엇을 평가하나 정보 추출에서 정밀도(Precision)는 뽑은 항목 중 맞는 항목의 비율이고, 재현율(Recall)은 뽑아야 할 항목 중 실제로 뽑은 비율이다. F1은 두 값의 조화평균으로, 0~1 사이의 점수다. F1 = 2 × Precision × Recall / (Precision + Recall) 일반적인 계산 예로, 정답 할 일이 10개인데 AI가 8개를 뽑았고 그중 6개가 맞았다면 정밀도는 75%, 재현율은 60%, F1은 약 0.67이다. 많이 뽑기만 하거나 일부만 정확하게 뽑는 것으로는 높은 점수를 얻기 어렵다. 다만 실제 평가에서는 무엇을 ‘맞는 항목’으로 인정하고, 어느 항목을 분모에 넣는지가 중요하다. 이 프로젝트의 기존 계산은 필수 정답과 매칭된 항목과 지어낸 항목으로 정밀도를 계산했다. 대화에는 있지만 정답과 매칭되지 않은 타당한 추가 항목은 extra 로 분류해 감점하지 않았다. 결정과 할 일은 각각 채점하고, 파일별 F1을 평균한 뒤 두 종류의 평균을 냈다. 아래 결과는 같은 합성 대본 4편의 noisy 입력을 3회 반복한 평가다. 같은 내용을 한 번 쓰면 누락으로 잡혔다 다음은 문제를 설명하기 위한 단순화한 예다. 실제 회의에서 가져온 인용은 아니다. 발언: 담당자가 금요일까지 검토 자료를 공유하기로 함 정답 데이터 결정사항: 금요일까지 검토 자료를 공유하기로 함 할 일: 검토 자료 공유하기 / 담당자 / 금요일 중복을 줄인 출력 할 일: 검토 자료 공유하기 / 담당자 / 금요일 정답 데이터에는 같은 약속이 결정사항과 할 일 양쪽에 있는 사례가 있었다. v2.1은 특정한 사람이 언제까지 무엇을 하겠다는 약속을 할 일에만 쓰도록 지시했다. 회의록에 정보는 남아 있지만, 종류별 매칭에서는 결정사항 하나를 놓친 것으로 처리한다. 결정 재현율이 떨어지고 F1도 내려간다. v2.1에서 정답과 매칭되지 않은 필수 결정은 7건이었다. 이 중 5건은 할 일에 남아 있었고, 2건은 결정·할 일·요약 어디에도 없었다. 같은 4편을 3회 실행한 결과에서 센 건수이며, 서로 다른 회의 7개를 뜻하지 않는다. 5건의 분류 이동과 2건의 실제 누락은 제품에 미치는 영향이 다르다. 둘을 모두 같은 누락으로 묶으면 중복 제거의 효과와 정보 손실을 구분하기 어렵다. 두 점수가 반대로 움직인 이유 v2.1은 중복과 불필요한 분할을 줄이는 지시 세 줄을 추가했다. 모델, 입력 형식, 출력 스키마, 정규화 로직은 유지했다. 평가 항목 v2 v2.1 기존 평균 F1 0.992 0.963 엄격 F1 하한 0.914 0.948 정답과 매칭되지 않은 extra, 3회 합 22 4 ‘엄격 F1 하한’은 이 평가에서 사용한 보수적인 계산이다. 정답과 매칭되지 않은 extra를 모두 오류로 세어 정밀도에 반영했다. 타당한 추가 정보도 감점할 수 있어 하한으로 해석했다. 기존 계산에서는 extra를 줄여도 직접적인 보상이 없었다. 반면 결정 항목이 할 일로 이동하면 결정 누락으로 감점됐다. 엄격 계산에서는 extra가 줄어든 효과가 반영되면서 점수가 올라갔다. extra 22건이 모두 중복이었다는 뜻은 아니다. 중복 외에도 한 결과물을 만드는 단계를 나눠 적거나, 목표를 할 일로 적는 사례가 섞여 있었다. 남은 4건도 대화에 있는 내용이었다. 따라서 이 수치를 ‘중복 22개를 4개로 줄였다’고 표현하면 부정확하다. 실제 누락은 프롬프트 충돌도 드러냈다 실제로 빠진 2건 중 하나에는 지시 충돌이 있었다. 규칙 A: 특정한 사람의 약속은 결정사항에 쓰지 않고 할 일에만 쓴다 규칙 B: 다음 분기 목표는 할 일에 다시 적지 않는다 ‘특정인이 맡은 다음 분기 목표’는 두 규칙에 함께 걸릴 수 있다. 결정사항에서 제외하고 할 일에서도 제외하면, 어느 쪽에도 남지 않는다. 다른 누락 1건은 원인이 명확하지 않았고, 같은 입력의 다른 반복에서는 결정사항에 있었다. 평가 기준과 출력 의도의 불일치가 있었다고 해서 점수 하락 전체를 평가 탓으로 돌릴 수는 없다. 실제 정보 손실과 반복 실행의 흔들림도 함께 드러났다. 기준 미달을 어떻게 처리했나 v2.1의 사전 채택 기준에는 평균 F1이 0.972 이상이어야 한다는 조건이 있었다. 결과는 0.963으로, 이 조건을 통과하지 못했다. 다른 채택 조건들은 통과했다. 당시에는 실패 항목과 원인을 공개한 뒤 PO 판단으로 평균 F1 조건의 예외를 인정하고 v2.1을 채택했다. 점수 기준을 사후에 고쳐 ‘모두 통과’로 처리하지는 않았다. 기존 버전도 보존해 기본값을 되돌릴 수 있게 했다. 이 선택에는 한계가 남는다. 프롬프트를 조정한 뒤 같은 합성 대본 4편으로 다시 평가했고, 정답 작성·프롬프트 설계·매칭 판정도 Claude가 담당했다. 반복 실행은 출력의 흔들림을 보여주지만 표본의 다양성을 늘려주지는 않는다. 별도 Codex 리뷰가 계산과 매칭 표본을 확인했어도 실제 회의 전반의 품질을 입증한 것은 아니다. 다음 평가는 무엇을 나눠 봐야 하나 후속 평가 문서에는 종류 간 중복과 결정·할 일 어디에도 없는 누락을 별도 지표로 정의하고, 정답의 분류 규칙도 함께 검토하도록 남겼다. 아직 그 평가를 완료한 결과는 아니다. 앞으로는 적어도 세 질문을 구분해야 한다. 필요한 정보가 문서에 남았는가, 적절한 섹션에 배치됐는가, 같은 정보가 불필요하게 반복되는가. 내용이 할 일에만 있어도 충분한 경우와 결정사항에도 반드시 있어야 하는 경우를 먼저 정해야 점수를 해석할 수 있다. 개발자로서는 계산을 재현할 수 있어야 하고, PO로서는 그 계산이 사용자가 읽고 실행할 문서의 품질을 얼마나 설명하는지 판단해야 한다. 이번 사례에서는 평균 F1 하나로 그 판단을 끝낼 수 없었다. 채택 예외와 실제 누락을 함께 남긴 이유다.
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
평가 점수가 떨어진 AI 프롬프트를 채택한 이유. AI Meeting Note의 기본 회의록에는 결정사항과 할 일이 나뉘어 있다. 프롬프트 v2를 평가했을 때, 같은 약속이 양쪽에 반복되거나 하나의 일을 여러 항목으로 나누는 문제가 관찰됐다. 이를 줄이려고 v2.1을 만들었다. 그런데 평가 결과는 한 방향으로 움직이지 않았다. 기존 평균 F1은 내려갔고, 추가 항목을 엄격하게 보는 F1은 올라갔다. 기본 프롬프트를 정하려면 점수가 무엇을 세고 있는지부터 확인해야 했다. F1은 무엇을 평가하나 정보 추출에서 정밀도(Precision)는 뽑은 항목 중 맞는 항목의 비율이고, 재현율(Recall)은 뽑아야 할 항목 중 실제로 뽑은 비율이다. F1은 두 값의 조화평균으로, 0~1 사이의 점수다. F1 = 2 ×…
Open source