Загружаем каталог…
Загружаем каталог…
평균 효과만 보면 놓치게 되는 것 지난 글에서는 Actor의 Belief를 그냥 prompt 안의 문장이 아니라: 저장 가능한 structured state 로 만들고, 가장 먼저: Known Belief ↓ Later Decision 이 가능한지부터 확인하기로 했다. 아직 Observation으로 Belief를 만드는 것도 아니고, Persistence를 보는 것도 아니었다. 질문은 단순했다. Belief 값만 바꿨을 때, 실제 선택도 예측 가능한 방향으로 달라지는가? 그리고 첫 결과만 봤을 때는 꽤 잘 된 것처럼 보였다. 1. 첫 실험은 1,664번 실행했다 구조는 꽤 크게 잡았다. Primary는: 32 parent scenarios × 5 belief levels × 2 decision contexts × 4 presentations = 1,280 calls 이었다. Belief level은: .1 .3 .5 .7 .9 다. 여기에: ABSENT diagnostic = 256 rule comprehension control = 64 belief-irrelevant control = 64 를 추가했다. 전체: 1,280 + 256 + 64 + 64 = 1,664 generations 이었다. 2. 기술적으로는 완벽하게 실행됐다 먼저 중요한 것. planned = 1664 attempted = 1664 committed = 1664 valid = 1664 invalid = 0 였다. Retry도 없었다. retry = 0 timeout = 0 missing = 0 duplicate = 0 즉 이후 이상한 결과를: JSON이 깨졌다 parser가 잘못 읽었다 응답이 누락됐다 같은 이유로 설명할 수는 없었다. 모델은 1,664번 모두 정상 형식으로 답했다. 3. 전체 효과만 보면 굉장히 좋아 보였다 Primary metric은: E_READ = R(.9) - R(.1) 이었다. 즉 Belief가 강한 FALSE 쪽일 때와, 강한 TRUE 쪽일 때 TRUE-aligned action 선택률이 얼마나 달라지는지 봤다. 결과: E_READ = 0.4921875 = +49.22pp 였다. 95% bootstrap interval도: [0.4648, 0.5195] 였다. 대략: +46.5pp ~ +52.0pp 범위였다. 처음 숫자만 봤을 때는 꽤 강해 보였다. 4. 32개 parent가 전부 같은 방향이었다 더 좋아 보이는 결과도 있었다. positive parents = 32 / 32 였다. 즉 32개의 parent scenario 모두, aggregate 기준으로는: HIGH belief > LOW belief 방향이었다. Family별 결과도 모두 양수였다. Family HIGH–LOW effect B1 +59.38pp B2 +51.56pp B3 +42.19pp B4 +43.75pp 이 정도만 보면: Belief State가 실제 행동에 꽤 잘 먹히는 것 아닌가? 라고 생각할 수 있다. 나도 처음에는 그렇게 봤다. 문제는 두 decision context를 따로 봤을 때 시작됐다. 5. 같은 Belief를 두 종류의 결정에 사용했다 지난 글에서 설명했듯, 하나의 Belief를 단순히 같은 형태의 문제에만 쓰지 않았다. 예를 들어: P = 북쪽 통로가 연결되어 있다 라는 Belief가 있다면, 첫 번째 context는: 연결된 통로를 선택한다 였다. 이 경우: P = TRUE → NORTH 가 맞다. 두 번째 context는 반대로: 연결되지 않은 통로를 선택한다 같은 구조였다. 이 경우: P = TRUE → SOUTH 가 맞다. 즉 같은 proposition을 사용하지만, 현재 goal에 따라 적절한 행동이 달라지게 만들었다. 이를: C1 C2 두 context로 나눴다. 6. C1은 거의 너무 잘 작동했다 C1의 endpoint 결과는: LOW belief (.1) = 0 / 128 = 0% HIGH belief (.9) = 128 / 128 = 100% 였다. 따라서: C1 effect = +100pp 였다. 말 그대로 완벽한 separation이었다. Belief LOW → FALSE 쪽 행동 Belief HIGH → TRUE 쪽 행동 이 정확하게 갈렸다. 이것만 보면 Belief Read는 성공처럼 보인다. 7. 그런데 C2는 거의 움직이지 않았다 C2는 완전히 달랐다. TRUE-aligned action rate: LOW belief (.1) = 119 / 128 = 92.97% HIGH belief (.9) = 117 / 128 = 91.41% 따라서: C2 effect = -1.56pp 였다. 즉: LOW ≈ HIGH 였다. Belief를 .1 에서 .9 로 바꿔도 C2에서는 선택이 거의 바뀌지 않았다. 8. +49%p의 정체는 ‘두 context에서 +49%p’가 아니었다 여기서 전체 결과를 다시 보면 이해가 된다. C1 = +100pp C2 = -1.56pp 두 context를 같은 비중으로 평균내면: (+100 - 1.56) / 2 ≈ +49.22pp 가 된다. 즉 전체: E_READ = +49.22pp 은 사실: 모든 상황에서 약 +49pp 정도의 안정적인 효과 가 아니었다. 실제 구조는: Context 1 → 완벽한 효과 Context 2 → 사실상 효과 없음 이었다. 이 차이가 이번 실험에서 가장 중요한 결과였다. 9. 32 / 32 positive parents 도 다시 봐야 했다 처음에는: positive parents = 32 / 32 가 굉장히 강한 generalization evidence처럼 보였다. 그런데 C1이 거의 모든 parent에서: +100pp 에 가까우면 이야기가 달라진다. 각 parent의 pooled effect가: (C1 effect + C2 effect) / 2 라면, C2가 거의 0이어도: (+100 + 0) / 2 = +50pp 가 된다. 즉 C1이 너무 강하면: C2가 실패해도 parent 전체 effect는 positive 가 될 수 있다. 그래서: 32 / 32 positive 는 실제 결과이지만, 이걸: 32개 scenario 모두에서 multi-context transfer가 성공했다. 라고 해석하면 안 됐다. 10. Family별로 C2만 봐도 같은 문제가 보였다 전체 family effect는 모두 좋아 보였다. Family Pooled effect B1 +59.38pp B2 +51.56pp B3 +42.19pp B4 +43.75pp 그런데 C2만 분리하면: Family C2 effect B1 +18.75pp B2 +3.13pp B3 −15.63pp B4 −12.50pp 였다. 원래 context effect 기준은: >= +20pp 였다. 따라서 C2 기준으로는: 0 / 4 families PASS 였다. 즉: 특정 family 하나가 문제였다 고 보기도 어려웠다. C2라는 구조 자체에서 광범위하게 문제가 나타났다. 11. Belief 값별 결과도 단순한 직선은 아니었다 전체 TRUE-aligned rate: Belief Rate .1 46.48% .3 45.70% .5 83.20% .7 97.66% .9 95.70% 단순한: .1 < .3 < .5 < .7 < .9 형태는 아니었다. 오히려 대략: .1 ≈ .3 ↓ 큰 점프 ↓ .5 ↓ .7 ≈ .9 에 가까웠다. Adjacent difference를 보면: .3 - .1 = -0.78pp .5 - .3 = +37.5pp .7 - .5 = +14.45pp .9 - .7 = -1.95pp 였다. 그래도 사전에 정의한: systematic middle reversal 기준에는 해당하지 않았다. 따라서 이걸 결과를 본 뒤: 새로운 실패 조건 으로 추가하지는 않았다. 그냥 중요한 diagnostic으로 남겼다. 12. 재미있는 결과 하나: ABSENT와 .5는 정말 달랐다 또 하나 꽤 흥미로운 결과가 있었다. BELIEF_ABSENT = 50.0% 반면: credence .5 = 83.20% 였다. 차이: ABSENT - .5 = -33.20pp 였다. 처음 설계할 때: BELIEF_ABSENT != credence .5 라고 정의했는데, 실제 behavior에서도 둘은 꽤 달랐다. 즉: 이 proposition에 대한 상태가 아예 없음 과: 이 proposition을 알고 있지만 현재 unresolved 상태 는 모델에게 동일하게 처리되지 않았다. 이건 main qualification을 살려주지는 못했지만, 구조적으로는 꽤 의미 있는 diagnostic이었다. 13. 단순한 A/B 코드나 위치 문제는 아니었다 Presentation도 따로 봤다. Presentation Success rate P1 69.38% P2 74.69% P3 71.88% P4 79.06% Nuisance gap은: code gap = 3.44pp position gap = 6.25pp 였다. 둘 다 큰 편은 아니었다. 또: belief-irrelevant endpoint gap = 0pp 였다. 즉 Belief 값을 넣기만 하면 아무 행동이나 밀어주는 식의 단순한 global effect도 관찰되지 않았다. 14. 그런데 rule comprehension이 또 실패했다 별도로: Belief 없이 주어진 rule과 state만 보고 정답 행동을 선택할 수 있는가? 를 확인하는 control을 넣었다. 결과: correct = 49 / 64 = 76.56% 였다. Frozen requirement는: >= 95% 였다. 즉: FAIL 이었다. 이 결과가 중요했다. C2가 안 움직인 이유가: Belief를 못 읽어서인지 아니면: Belief를 읽은 뒤 적용해야 하는 decision rule 자체를 잘 못 풀어서인지 분리하기 어려워졌기 때문이다. 15. 그래서 최종 판정은 성공이 아니었다 Frozen gate를 그대로 적용한 결과: ALL_FAILURES = [ C2_EFFECT, RULE_COMPREHENSION ] 였다. 최종 classification: MEASUREMENT_LIMITED 였다. 그리고: T2_ELIGIBLE = FALSE 가 됐다. 즉 다음 단계였던: Observation → Belief Write 실험으로 넘어가지 않았다. 16. 중요한 건 ‘Belief가 실패했다’는 결과가 아니라는 점이다 이번 결과를: Belief State는 안 된다 라고 해석하면 안 된다. 실제로는: C1 = +100pp 처럼 Belief와 행동 사이에 아주 강한 separation이 나타난 조건도 있었다. 문제는: C2 ≈ 0 Rule comprehension = 76.56% 였다. 따라서 정확한 결론은: structured Belief-associated behavior는 일부 조건에서 강하게 관찰됐지만, clean multi-context Belief Read를 검증하기 위한 measurement가 충분히 qualification되지 않았다. 이다. 다시 말하면: MEASUREMENT FAILURE != BELIEF FAILURE 이다. 17. 그래서 Observation → Belief 실험은 아직 시작하지 않았다 원래 다음 단계는: Observation ↓ Belief Update Proposal ↓ Commit ↓ Fresh Session ↓ Decision 이었다. 하지만 Read Path에서: Belief를 읽는 문제 vs Decision Rule을 이해하는 문제 가 분리되지 않은 상태에서 Write까지 넣으면, 원인을 더 알기 어려워진다. 그래서: Write = NOT_EVALUATED Persistence = NOT_EVALUATED Revision = NOT_EVALUATED 상태로 그대로 멈췄다. 이 세 개가 실패한 것이 아니다. 아직 시험하지 않은 것이다. 18. 이제 가장 먼저 확인해야 할 것이 바뀌었다 처음 질문은: Belief를 넣으면 행동이 달라지는가? 였다. 1,664번 실행한 뒤 질문은 달라졌다. C2 결과가 이상한 이유가 정말 모델 behavior 때문인가? 아니면: 정답 mapping이 틀렸나? scorer가 잘못됐나? A/B presentation이 뒤집혔나? C2 rule 자체가 모호했나? generator와 scorer가 같은 잘못된 가정을 공유하고 있나? 부터 확인해야 했다. 즉 새 실험을 바로 돌리는 대신, 이미 나온: 1,664 responses 를 전부 다시 뜯어보기로 했다. 다음 편 결과가 이상해서 1,664개 응답을 전부 다시 뜯어봤다 다음에는 model을 다시 돌리지 않았다. 대신: 실제 prompt public rule physical action A/B mapping raw response production scorer 를 처음부터 독립적으로 다시 연결했다. 결과는 조금 의외였다. mapping mismatch = 0 scoring mismatch = 0 ambiguous context = 0 production / independent agreement = 1664 / 1664 였다. 즉 처음 의심했던: “그냥 실험 코드가 잘못된 것 아니야?” 라는 설명이 점점 어려워졌다.
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
믿음값을 바꾸니 선택이 49%p 움직였다. 그런데 실험은 실패했다. 평균 효과만 보면 놓치게 되는 것 지난 글에서는 Actor의 Belief를 그냥 prompt 안의 문장이 아니라: 저장 가능한 structured state 로 만들고, 가장 먼저: Known Belief ↓ Later Decision 이 가능한지부터 확인하기로 했다. 아직 Observation으로 Belief를 만드는 것도 아니고, Persistence를 보는 것도 아니었다. 질문은 단순했다. Belief 값만 바꿨을 때, 실제 선택도 예측 가능한 방향으로 달라지는가? 그리고 첫 결과만 봤을 때는 꽤 잘 된 것처럼 보였다. 1. 첫 실험은 1,664번 실행했다 구조는 꽤 크게 잡았다. Primary는: 32 parent scenarios…
Открыть источник