Loading the catalog…
Loading the catalog…
ReAct 논문 은 언어 모델에게 생각(추론)과 행동을 번갈아 내게 하면 둘이 서로를 보완한다고 주장한다. 지금 에이전트들이 쓰는 "생각하고, 도구를 부르고, 결과를 보고, 다시 생각하는" 순서를 논문은 어떻게 실험했고 무엇이 나왔는지 원문 숫자로 정리했다. 들어가며: 논문 정보 저자는 프린스턴대 2명과 Google Research Brain 팀 5명, 모두 7명이고 Shunyu Yao가 제1저자다. arXiv에 2022년 10월 6일 처음 올라왔고 ICLR 2023에서 발표됐다. 실험의 주 모델은 PaLM-540B이고, 부록 표(Table 5)에서는 같은 ReAct 프롬프트를 GPT-3(text-davinci-002)로도 돌려 비교한다. 1부. 방법 생각·행동·관찰 ReAct가 과제를 푸는 기록, 곧 궤적(trajectory)은 매 단계를 Thought , Action , Observation 으로 적는다. 모델이 생각을 적고, 행동을 하나 고르고, 환경이 돌려준 관찰을 보고 다음 생각을 적는다. 생각은 환경을 바꾸지 않는다. 계획을 세우고, 관찰에서 필요한 정보를 뽑고, 다음 행동을 정하는 데 쓰인다. 행동 공간 지식 과제는 여러 문서를 거쳐 답해야 하는 질문 답변(HotpotQA)과 주장이 사실인지 판정하는 과제(Fever)다. 여기서는 논문이 만든 간단한 Wikipedia API를 쓴다. 행동은 셋이다. search[entity] 는 그 항목 문서의 첫 5문장을 돌려주고, 문서가 없으면 비슷한 항목 5개를 제안한다. lookup[string] 은 열린 문서에서 그 문자열이 든 다음 문장을 돌려준다(브라우저의 Ctrl+F와 같다). finish[answer] 는 답을 내고 끝낸다. 논문은 이 행동 공간이 최신 검색기보다 훨씬 약하다고 밝힌다. 사람이 Wikipedia를 다루는 방식을 흉내 내려는 설계라는 것이다. 비교 대상 비교 대상은 ReAct 궤적에서 일부를 지워 만든다. Standard : 생각·행동·관찰을 모두 지운 일반 프롬프트 CoT(Chain-of-Thought) : 행동과 관찰을 지우고 추론만 남긴 것 CoT-SC(Self-Consistency) : CoT 궤적 21개를 온도 0.7로 뽑아 다수결로 답을 고르는 것 Act : 생각을 지우고 행동과 관찰만 남긴 것 ReAct와 CoT-SC를 섞는 방법도 둘 시험했다. ReAct→CoT-SC 는 ReAct가 정해진 단계(HotpotQA 7단계, Fever 5단계) 안에 답을 못 내면 CoT-SC로 넘어간다. CoT-SC→ReAct 는 CoT-SC 표본 n개 중 다수 답이 n/2번 미만으로 나오면, 즉 모델 내부 지식만으로는 확신이 없으면 ReAct로 넘어간다. 2부. 지식 과제 — HotpotQA와 Fever HotpotQA는 정답과 정확히 같은지(EM, exact match)로, Fever는 정확도로 잰다. ReAct 단독은 Fever에서 CoT를 앞섰고(60.9 대 56.3) HotpotQA에서는 조금 뒤졌다(27.4 대 29.4). 가장 높은 점수는 두 방법을 섞은 쪽에서 나왔다. HotpotQA는 ReAct→CoT-SC가 35.1, Fever는 CoT-SC→ReAct가 64.6이었다. 참고로 같은 표의 지도 학습 최고 기록은 HotpotQA 67.5, Fever 89.5로, 프롬프트만 쓴 방법들과 차이가 컸다. 무엇이 맞고 무엇이 틀렸나 저자들은 HotpotQA에서 ReAct와 CoT의 궤적을 정답 50건, 오답 50건씩, 모두 200건을 골라 직접 분류했다(Table 2). 정답이었지만 추론이나 사실이 환각이었던 경우(거짓 양성)는 CoT가 14%, ReAct가 6%였다. 오답 가운데 환각이 원인인 경우는 CoT가 56%로 가장 큰 실패 유형이었고, ReAct는 0%였다. 반대로 추론 오류는 ReAct가 47%, CoT가 16%였다. 논문은 생각·행동·관찰을 번갈아 하는 구조가 근거를 단단하게 하는 대신 추론의 유연성을 줄였다고 본다. ReAct에만 있는 흔한 오류로 같은 생각과 행동을 되풀이하는 경우를 들고, 이를 추론 오류에 넣어 셌다. ReAct 오답의 23%는 검색 결과가 비었거나 쓸모없는 경우였다. 답은 맞았는데 정답 표기와 정확히 같지 않아 오답이 된 경우는 ReAct 29%, CoT 28%였다. 3부. 의사결정 과제 — ALFWorld와 WebShop ALFWorld는 글로 된 가상 집안 환경에서 "물건 찾아 옮기기" 같은 일을 해내는 과제이고, WebShop은 실제 상품 데이터로 만든 쇼핑 사이트에서 지시에 맞는 상품을 사는 과제다. 이 두 과제에서는 생각을 매 단계가 아니라 필요할 때만 드문드문 넣는다. ALFWorld에서 ReAct는 6번 시도 중 가장 좋은 회차가 성공률 71%로, Act의 최고(45%)와 BUTLER의 최고(37%)를 앞섰다. 가장 나쁜 ReAct 회차(48%)도 두 방법의 최고 회차보다 높았다. 6번의 대조 실험에서 Act 대비 상대 향상은 33~90%, 평균 62%였다. WebShop에서는 ReAct의 성공률이 40.0%로 Act(30.1%)보다 높았다. 이전 최고 기록은 사람이 단 궤적 1,012개로 학습한 모방 학습(IL, 29.1%)과 지시 10,587개로 더 학습한 모방+강화 학습(IL+RL, 28.7%)이었는데, 이보다 10%p 남짓 높다. 다만 숙련자의 59.6%와는 차이가 컸다. 논문은 사람이 상품을 훨씬 많이 살펴보고 검색어를 고쳐 쓴다고 설명한다. 마치며 ReAct는 생각·행동·관찰을 번갈아 적는 형식을 프롬프트로 시험했다. 지식 과제에서 ReAct 단독은 Fever에서 CoT를 앞서고 HotpotQA에서 조금 뒤졌으며, 둘을 섞은 방법이 가장 높았다. 실패 분석에서는 CoT보다 환각이 적고 추론 오류가 많았다. 의사결정 과제에서는 생각을 지운 Act보다 꾸준히 높았다. 이 시리즈의 SWE-agent 글 에서 다룬 에이전트도 매 단계 생각과 명령을 하나씩 내는데, SWE-agent 논문은 이 방식의 출처로 ReAct를 인용한다. 참고 ReAct: Synergizing Reasoning and Acting in Language Models — arXiv:2210.03629, ICLR 2023
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
ReAct 논문 읽기 — 생각과 행동을 번갈아 하는 루프. ReAct 논문 은 언어 모델에게 생각(추론)과 행동을 번갈아 내게 하면 둘이 서로를 보완한다고 주장한다. 지금 에이전트들이 쓰는 "생각하고, 도구를 부르고, 결과를 보고, 다시 생각하는" 순서를 논문은 어떻게 실험했고 무엇이 나왔는지 원문 숫자로 정리했다. 들어가며: 논문 정보 저자는 프린스턴대 2명과 Google Research Brain 팀 5명, 모두 7명이고 Shunyu Yao가 제1저자다. arXiv에 2022년 10월 6일 처음 올라왔고 ICLR 2023에서 발표됐다. 실험의 주 모델은 PaLM-540B이고, 부록 표(Table 5)에서는 같은 ReAct 프롬프트를 GPT-3(text-davinci-002)로도 돌려 비교한다. 1부.…
Open source