Loading the catalog…
Loading the catalog…
거대 언어 모델(LLM)을 소프트웨어 파이프라인에 결합할 때 발생하는 가장 큰 병목은 텍스트 생성 방식 그 자체에 있습니다. 전통적인 자기회귀 모델의 순차적 토큰 생성과 파싱 과정을 걷어내고, 단일 순방향 패스로 정밀 보정된 확률 결정을 반환하는 '시스템 1' 전용 의사결정 모델이 지연 시간과 비용 문제를 근본적으로 해결하는 대안으로 자리 잡고 있습니다. How Can A Model Be Better Without Generating Words? 텍스트 생성의 한계와 결정 전용 모델 'Jev'의 등장 기존 소프트웨어 시스템은 문장이나 단락 형태의 텍스트가 아니라 approve 나 reject 와 같은 명확하고 구조화된 상태값을 요구합니다. 그러나 전통적인 자기회귀(Autoregressive) LLM은 확률적 텍스트를 토큰 단위로 하나씩 풀어내는 구조로 동작합니다. 개발자는 프롬프트 엔지니어링이나 JSON 스키마 강제 기법을 거쳐 모델이 뱉어낸 텍스트를 다시 소프트웨어 상태값으로 파싱해야 했습니다. 이 과정에서 포맷 오류, 런타임 예외, 불필요한 출력 토큰 대기 시간으로 인한 지연이 상시 발생했습니다. 2026년 9월, ChatGPT 지시 튜닝 공동 연구자인 Diogo Almeida가 창업한 TypeSafe AI는 자유 텍스트 생성을 완전히 배제하고 구조화된 결정만을 내리는 모델 Jev 를 공개했습니다. Jev는 인간 심리학의 시스템 1(System 1) , 즉 직관적이고 즉각적인 판단 개념을 차용했습니다. 비정형 텍스트로 된 입력 상태와 결정해야 할 질문, 그리고 허용된 선택지 목록을 인자로 받아 토큰 생성 없이 옵션별 확률 분포만을 직접 계산해 반환합니다. Jev는 세 가지 의사결정 출력 형식을 지원합니다. CHOICE : 최대 255개의 선택지 중 하나를 선택하며 전체 확률 분포를 반환합니다. SCORE : 순서가 있는 척도(예: 0~4점)에 걸친 가중 평균 점수와 분포를 반환합니다. NOUL : 참/거짓 판단과 함께 각 상태의 정확한 보정 확률(예: 사기 거래 여부 87%)을 직접 출력합니다. 일반 LLM과 Jev를 필두로 한 시스템 1 의사결정 모델의 구조적 차이는 다음과 같습니다. 기능 구분 일반 LLM (Autoregressive) 시스템 1 모델 (Jev 등) 출력 방식 토큰 단위 순차 생성 ( text -> json ) 단일 순방향 패스(1-pass) 확률 직접 출력 소프트웨어 연동 파싱 로직 필수, 문법 에러 위험 결정값·확률을 코드에서 즉시 조건문으로 활용 지연 시간 수백 ms ~ 수 초 (토큰 수 비례) 70 ~ 500 ms (상태 크기에만 비례) 출력 비용 입력 대비 ~5배 고가 $0 (토큰을 생성하지 않음) 성능 격차의 원인: 1-Pass 연산과 RLCD를 통한 신뢰도 보정 일반적인 자기회귀 LLM은 단 하나의 단어를 결정하기 위해서도 이전 토큰을 콘텍스트에 누적해가며 모델 전체를 수십 번 반복 실행(Forward Pass)해야 합니다. 반면 Jev는 허용된 옵션 집합에 대해 단 한 번의 패스(1-pass)로 연산을 끝냅니다. 이러한 구조적 차이 덕분에 엔드투엔드 지연 시간이 70~500ms 수준으로 압축됩니다. TypeSafe 자체 벤치마크 기준 프론티어 생성형 모델 대비 최대 194배 빠르고 440배 저렴합니다. 가격 정책 역시 차별화되어 입력 100만(1M) 토큰당 $0.042(10억 토큰당 $42)이며, 출력 토큰 비용은 아예 책정되지 않습니다($0). 단순 분류기와 Jev를 구분 짓는 가장 중요한 기술적 차이는 RLCD(Reinforcement Learning for Calibrated Decisions) 입니다. 일반적인 소형 분류기나 LLM이 출력하는 소프트맥스 신뢰도 수치는 과적합이나 편향으로 인해 임의적인 경우가 많아 소프트웨어의 분기 조건으로 그대로 사용하기 어렵습니다. Jev는 모델이 90% 신뢰도로 판단한 결정이 통계적으로 실제 10번 중 9번 들어맞도록 정밀 보정(Calibration)을 거쳤습니다. 소프트웨어 제어 하네스(Harness)는 이 정밀 보정된 확률값 $p$를 전달받아 명확한 정책 분기를 실행할 수 있습니다. $p \ge 0.96$: 사람의 개입 없이 즉시 기능을 자동 실행( execute ) $0.70 \le p < 0.96$: 신뢰도가 기준치에 미치지 못하므로 운영자 승인 요청( ask a human ) $p < 0.70$: 단순 결정이 어려운 복잡한 상태로 간주하여 더 무겁고 정밀한 추론형 LLM으로 작업 에스컬레이션( escalate ) 시스템 1 모델의 내부 구조: 양방향 인코더와 대안 프로젝트들 Jev는 세부 아키텍처를 완전히 공개하지 않았으나, Fastino AI가 발표한 정보 추출/분류 모델 GLiNER2 와 입력 가드레일 모델 GLiGuard 의 구조를 통해 기저 동작 원리를 파악할 수 있습니다. 이들은 다음 토큰을 가리는 인과적 마스킹(Causal Masking) 대신 모든 토큰이 입력을 한 번에 상호 참조하는 BERT 스타일의 양방향 트랜스포머 인코더(Bidirectional Transformer Encoder) 를 사용합니다. 입력 텍스트와 태스크 정의, 후보 라벨( [L] safe , [L] unsafe )을 단일 시퀀스로 묶어 인코딩한 뒤, 각 라벨 토큰의 표현 벡터를 소형 공유 MLP(다층 퍼셉트론)에 통과시켜 로짓(Logit)과 소프트맥스 확률을 추출하는 구조입니다. Jev 등장 전후로 오픈소스 및 주요 AI 기업 진영에서도 동일한 메커니즘을 적용한 구현체가 발표되었습니다. Laya (Convai) : 3억 9,500만(395M) 파라미터의 ModernBERT-large 백본에 2개 트랜스포머 레이어로 구성된 의사결정 헤드 및 에스컬레이션 헤드를 얹어 총 421M 파라미터로 구축되었습니다. 2,000개 결정 벤치마크에서 미세조정 버전 기준 76.6%의 정확도와 약 16ms의 지연 시간을 기록했습니다. Von : ModernBERT-large 백본을 사용하며 Jev와 동일한 API 인터페이스 호환성을 제공합니다. 크로스 엔트로피 손실 외에 브라이어 점수 손실(Brier Score Loss)과 후처리 온도 스케일링(Temperature Scaling)을 적용해 확률 보정 품질에 집중했습니다. 로컬 GPU 및 애플 실리콘 환경에서 약 18ms의 지연 시간을 달성했습니다. GLiNER 2.5-Decide (Fastino) : DeBERTa-v3-large (340M) 기반으로 오픈소스 의사결정 벤치마크 성능을 갱신한 후속 모델입니다. 기존 LLM의 로짓 재활용 기법 : Qwen 계열 모델을 활용해 선택지 인덱스(0, 1, 2, 3) 토큰 위치의 로짓만 직접 정규화해 추출하는 System One 방식, 전체 후보 문자열 시퀀스의 누적 로그 확률($\sum \log p$)을 비교하는 OpenJev 방식이 공유 KV 캐시를 통해 연구되고 있습니다. 기타 주요 동향 : Liquid AI는 2026년 9월 다국어 지원 의사결정 전용 모델인 D1 을 공개했으며, OpenAI는 DevDay 2026에서 자체 의사결정 엔드포인트인 Decisions API 티저를 공개했습니다. 한편 음성 에이전트 인프라 측면에서는 83개 언어를 단일 모델로 지원하며 MCP 연동을 제공하는 텍스트-음성 변환 플랫폼 Fish Audio(S2.1 Pro) 등이 연계 기술로 결합되는 추세입니다. 정리 에이전트 파이프라인에서 단순 분류, 부서 라우팅, 가드레일 판별과 같은 결정 작업을 거대 자기회귀 LLM에 맡기고 텍스트 출력을 파싱하는 방식은 속도와 비용 면에서 명확한 한계를 지닙니다. 텍스트 생성을 포기하고 단일 순방향 패스로 보정된 확률 분포를 출력하는 비자기회귀 의사결정 모델(Jev, Laya, Von 등)은 지연 시간을 수십 밀리초대로 낮추고 출력 토큰 비용을 0으로 만듭니다. 에이전트 아키텍처를 설계할 때는 모든 판단을 고가의 생성형 LLM에 의존하기보다, 앞단에 RLCD 기반의 시스템 1 모델을 배치해 신뢰도 확률($p$)에 따라 자동 실행, 운영자 검토, 대형 추론 모델 호출로 분기하는 다단계 제어 구조를 구축하는 것이 실용적인 표준으로 자리잡고 있습니다. 다룬 영상 How Can A Model Be Better Without Generating Words? — bycloud · 17분
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
텍스트 생성을 버리고 단일 패스 결정으로 전환하는 법. 거대 언어 모델(LLM)을 소프트웨어 파이프라인에 결합할 때 발생하는 가장 큰 병목은 텍스트 생성 방식 그 자체에 있습니다. 전통적인 자기회귀 모델의 순차적 토큰 생성과 파싱 과정을 걷어내고, 단일 순방향 패스로 정밀 보정된 확률 결정을 반환하는 '시스템 1' 전용 의사결정 모델이 지연 시간과 비용 문제를 근본적으로 해결하는 대안으로 자리 잡고 있습니다. How Can A Model Be Better Without Generating Words? 텍스트 생성의 한계와 결정 전용 모델 'Jev'의 등장 기존 소프트웨어 시스템은 문장이나 단락 형태의 텍스트가 아니라 approve 나 reject 와 같은 명확하고 구조화된 상태값을 요구합니다. 그러나…
Open source