OpenAI가 DevDay에서 개발자와 사용자를 위한 대규모 신규 기능과 요금제를 대거 공개했습니다. 앱 개발자가 사용자의 구독 자원을 직접 활용할 수 있는 새로운 인증 방식부터 초고속 추론 모델, 상시 작동형 에이전트 서비스가 도입되었으며, 이에 맞서 로컬 환경에서 비용 효율적으로 구동 가능한 오픈소스 모델 생태계도 함께 조명받고 있습니다. The one OpenAI announcement that can actually make you money... OpenAI 신규 서비스 및 요금제 공개 OpenAI는 이번 발표를 통해 개발자의 비즈니스 모델을 바꾸고 모델 라인업을 다변화하는 여러 핵심 기능과 요금제를 제시했습니다. Sign in with ChatGPT : 이번 발표에서 가장 주목받는 기능으로, 개발자가 사용자에게 API 비용을 직접 청구하거나 부담하지 않고도 앱을 빌드할 수 있게 해주는 새로운 인증 방식입니다. 외부 앱에서 이 인증을 사용하면 사용자가 보유한 ChatGPT 의 기존 토큰을 앱 서비스 소비에 직접 소진할 수 있어, 개발자에게 강력한 수익화 도구로 작용합니다. Dots : GPT-6 Astra 모델을 기반으로 동작하는 개인용 AI 에이전트 서비스입니다. 단발성 응답을 넘어 사용자를 위해 24시간 상시 작동하며 복잡한 연속 업무를 수행합니다. Pro 500 플랜 & UltraFast : 월 $500 기반의 엔터프라이즈급 Pro 500 플랜이 신설되었습니다. 이 플랜과 함께 공개된 UltraFast 추론 모드는 초당 300토큰이라는 압도적인 처리 속도를 제공하여 실시간 응답이 필수적인 애플리케이션에 최적화되어 있습니다. GPT-6.1 Sol & Decisions API : GPT-6.1 Sol 은 고성능을 유지하면서도 구동 비용을 대폭 낮춘 효율적 모델입니다. 함께 공개된 Decisions API 는 정형 데이터 분류 및 의도 파악 업무를 전용으로 처리하도록 설계된 특화 API입니다. Fastino Labs의 GLiNER 2.5 / GLiDE (오픈소스 대안) OpenAI가 비공개 상용 모델 기반으로 의도 분류 및 데이터 처리 API 시장을 확장함에 따라, 이에 대응하는 로컬 오픈웨이트 모델 생태계도 빠르게 발전하고 있습니다. Fastino Labs 는 OpenAI의 독점적 API 시스템에 종속되지 않고 자체 서버나 로컬 환경에서 구동할 수 있는 GLiNER 2.5 및 GLiDE 모델을 선보였습니다. 이 모델들은 클라우드 API 호출 비용을 지불하지 않고도 정형 데이터 추출, 엔티티 인식, 의도 분류 작업에서 매우 높은 정확도와 빠른 추론 속도를 발휘합니다. 외부 API 의존도를 낮추고 데이터 보안과 비용 절감을 동시에 달성하려는 개발자들에게 강력한 오픈소스 대안이 됩니다. 정리 OpenAI는 Sign in with ChatGPT 를 통해 개발자가 API 비용 부담 없이 사용자 구독 자원으로 수익을 창출할 수 있는 생태계를 구축하고, UltraFast 및 Dots 로 고성능 에이전트 시장을 선점하려 합니다. 반면 비공개 클라우드 API의 비용과 데이터 종속성에 대응하여, GLiNER 2.5 와 같은 로컬 오픈소스 모델이 정밀 데이터 처리 영역에서 실질적인 대안으로 떠오르며 상용 플랫폼과 오픈소스 생태계 간의 양강 구도가 더욱 뚜렷해지고 있습니다. 다룬 영상 The one OpenAI announcement that can actually make you money... — Fireship · 5분
구글이 약 7개월간의 경량화 모델 집중 기간을 거쳐 최상위 지능을 지향하는 신규 프론티어 모델 Gemini 4 Argon 을 공개했습니다. 이번 발표는 단순한 지능 지수의 상승을 넘어 단일 응답에서 최대 100만 토큰을 출력할 수 있는 압도적인 컨텍스트 창과 15% 수준의 극도로 낮춘 환각률을 특징으로 합니다. Artificial Analysis의 인텔리전스 및 비용 지표를 바탕으로 Argon의 기술적 구조, 비용 효율성, 에이전트 수행 능력의 실무적 트레이드오프를 상세히 분석합니다. Gemini 4 Argon Gemini 4 Argon의 지능 수준과 프론티어 재진입 구글은 Gemini 3.1 Pro 출시 이후 Gemini 3.6, 3.7, 3.8 등 Flash 라인업을 중심으로 고속·경량 추론에 집중해 왔습니다. 하지만 마침내 최상위 프론티어급 모델인 Gemini 4 Argon 을 공개하며 테스트 단계에 들어갔고, OpenAI 및 Anthropic과의 최상위 지능 경쟁에 다시 진입했습니다. Artificial Analysis Intelligence Index 평가에서 Argon은 53점을 기록했습니다. 이는 OpenAI의 GPT-6 Astra (53점)와 정확히 동률을 이루며, GPT-6.1 Sol (52점)을 오차 범위 내에서 앞서는 수치입니다. 구글의 이전 프론티어 모델이었던 Gemini 3.1 Pro Preview (30점)와 비교하면 무려 23점이 상승했습니다. 이로써 프론티어 AI 시장은 구글, OpenAI, Anthropic의 3파전 구도로 재편되었습니다. 모델 Artificial Analysis Intelligence Index 비고 Gemini 4 Argon 53 구글의 신규 프론티어 모델 GPT-6 Astra 53 Argon과 동률 GPT-6.1 Sol 52 Argon 대비 -1점 Gemini 3.1 Pro Preview 30 구글 전작 대비 +23점 상승 Argon은 단순 지능 수치 향상 외에도 긴 맥락을 한 번에 다루는 능력과 복잡한 작업을 끝까지 완수하는 지량형 에이전트 성능에 초점을 맞춰 설계되었습니다. 현재 선택된 일부 사용자들을 대상으로 필드 테스트가 진행 중이며 곧 광범위한 API 서비스로 확장될 예정입니다. 단일 응답 100만 토큰 출력의 구조적 이점 Argon이 가진 가장 강력한 스펙상 차별점은 단일 응답(Single Response) 시 최대 100만(1M) 토큰을 연속으로 생성할 수 있다는 점입니다. 경쟁 모델인 Opus 5.5 , Fable 5.1 , GPT-6 Astra 가 최대 128K 토큰 출력을 지원하고, 구글의 Gemini 3.8 Flash 가 64K 출력을 지원했던 것과 비교하면 약 8배 확장된 생성 한계입니다. [ 기존 프론티어 모델 ] ──► 최대 128K Output Cap (중간 요약/압축으로 맥락 유실 발생) [ Gemini 4 Argon ] ──► 최대 1M Output Cap (단일 패스 유지, 전체 변수 및 맥락 보존) 출력 창이 100만 토큰으로 넓어지면 대규모 작업을 처리할 때 에이전트 컨트롤 하네스(Harness)가 중간에 출력을 끊고 토큰을 요약·압축한 뒤 다시 루프를 돌리는 번거로운 과정이 사라집니다. 전체 코드베이스 재작성이나 대규모 라이브러리 마이그레이션 작업 시, 중간 단절 없이 단일 패스(One pass)로 전체 구조를 일괄 생성할 수 있어 변수명 일관성과 모듈 간 인터페이스 일치도가 대폭 상승합니다. 실제로 구글은 C/C++ 기반의 AV1 비디오 디코더 라이브러리인 libgav1 전체를 Rust 언어로 완전히 재작성하여 실행 성능을 2.7배 향상시키는 고난도 에이전트 작업을 Argon 단일 모델 기반으로 완수했습니다. 다만 이러한 초장문 출력에는 명확한 속도 측면의 트레이드오프가 따릅니다. 현재 Argon의 생성을 초당 100토큰(tok/s)으로 가정한 경우, 최대치인 100만 토큰을 모두 받아내는 데 걸리는 실제 벽시계 시간(Wall-clock time)은 약 3시간에 달합니다. 약 300 tok/s를 출력하는 Gemini 3.8 Flash나 OpenAI의 UltraFast 계열 모델처럼, 향후 대용량 생성 환경에 맞춘 디코딩 최적화 및 속도 향상 작업이 필수 과제로 남아있습니다. 작업당 토큰 효율성, 비용, 환각률 검증 Artificial Analysis의 최근 데이터에 따르면, 단순 인텔리전스 점수보다 작업당 필요한 토큰 수(Tokens per task) 가 실제 운영 지연 시간과 비용을 결정하는 더 핵심적인 지표로 다뤄지고 있습니다. Gemini 3.6 Flash를 비롯한 기존 모델들은 높은 지능에도 불구하고 단일 과제를 해결하기 위해 너무 많은 토큰을 남발하여 비용 효율성이 떨어지는 문제가 있었습니다. Argon은 작업당 토큰 생성 효율성을 최적화하여 이러한 과도한 생성을 제어했습니다. Argon의 API 출시 가격은 100만 토큰을 기준으로 입력 $2(현재 출시 기념 50% 할인 적용 상태, 정가 $4), 출력 $10(정가 $20)로 책정되었습니다. 특히 캐시된 입력(Cached Input)에 대해서는 95%의 파격적인 할인이 적용됩니다. 인텔리전스 인덱스 표준 과제 수행 시 발생하는 작업당 평균 비용을 계산하면 다음과 같습니다. [작업당 비용 비교 (Intelligence Index Task)] - GPT-6 Astra : $3.26 - Gemini 4 Argon: $1.99 (Astra의 60% 수준) - GPT-6.1 Sol : $0.72 Argon의 작업당 비용인 $1.99는 GPT-6 Astra($3.26)와 비교했을 때 60% 수준으로 경제적입니다. 하지만 이 비용 절감은 토큰 생성 개수가 획기적으로 줄어들었기 때문이라기보다는 단가 할인 프로모션의 영향이 더 큽니다. 실제로 동일한 작업을 수행할 때 생성하는 토큰의 개수만 보면 Argon이 GPT-6 Astra보다 약 1.2배 더 많은 토큰을 소비합니다. 한편 극도의 비용 효율을 자랑하는 GPT-6.1 Sol($0.72)에 비해서는 Argon의 작업당 비용이 약 2.7배 높습니다. 신뢰성과 지식 정확도 측면에서는 AA-Omniscience 환각률 평가가 주요 지표로 활용됩니다. Argon은 해당 평가에서 15%라는 매우 낮은 환각률을 보였습니다. GPT-6 Astra(51%)나 GPT-6.1 Sol(54%)이 절반 이상의 오답이나 환각을 생성한 것에 비하면 놀라운 수준입니다. Argon은 지식이 확실하지 않은 질문에 대해 억지로 사실을 지어내기보다 "모른다"고 답변하는 비중(85%)을 대폭 늘리도록 최적화 훈련을 받았습니다. 다만 이로 인해 질문에 맞혀서 얻는 정답률 자체는 다소 제한되어, 종합 지식 점수에서는 Astra와 비슷한 42~43점대에 머물렀습니다. 에이전트 환경 수행 능력은 벤치마크 성격에 따라 엇갈린 결과를 보였습니다. 자동화 및 에이전트 작업 제어 능력을 측정하는 AutomationBench-AA 에서는 77.5%로 전체 1위를 차지했습니다. 반면 실제 터미널 명령어 조작 및 개발 환경 제어 능력을 다루는 Terminal-Bench 4.0 에서는 57%를 기록하여, Sonnet 5.5 (64%)나 Opus 5.5 (60%) 같은 개발 특화 프론티어 모델들에 비해 다소 열세를 나타냈습니다. 정리 Gemini 4 Argon의 등장으로 프론티어 AI 시장은 구글, OpenAI, Anthropic의 균형 잡힌 3파전 구도로 복귀했습니다. Argon의 핵심 경쟁력은 단일 패스로 전체 작업을 완성할 수 있는 100만 토큰 단일 응답 창 과 환각 발생률을 15%까지 낮춘 고신뢰도 응답 성향 입니다. 실무 개발자 및 엔지니어링 팀은 Argon을 도입할 때 다음과 같은 방향으로 시스템을 전환하는 것이 유리합니다. 컨트롤러 구조 단순화 : 기존에는 128K 출력 제한 때문에 코딩 작업을 여러 단계로 나누어 요약하고 다시 전달하는 복잡한 에이전트 루프가 필요했으나, Argon 도입 시 대규모 마이그레이션 및 코드 생성 작업을 단일 요청 프롬프트로 통합할 수 있습니다. 환각 검증 라우터 활용 : 오답을 사실처럼 말하면 안 되는 서비스나 RAG 시스템 전면에 Argon을 배치하면, 잘못된 정보 전달을 막고 "모름"으로 응답을 격리하는 안전장치로 사용할 수 있습니다. 프롬프트 캐싱 극대화 : 캐시 입력에 적용되는 95% 할인율을 활용해 대용량 코드베이스나 문서를 캐싱해 두고, 단일 생성 시 발생하는 토큰 단가 비용 부담을 offset하는 구조를 설계해야 합니다. 다룬 영상 Gemini 4 Argon — Sam Witteveen · 10분
토큰/초만 보는 벤치마크는 오프로드 붕괴를 숨깁니다. TTFT(첫 토큰까지 시간)를 보세요. 왜 이 글을 쓰게 됐나 "16GB면 이 모델 돌아가나요?" 질문에는 정답이 두 개 있습니다. 로딩이 되느냐 — 가중치 파일 크기만 보면 답이 나옵니다. 실제로 쓸 만하느냐 — 컨텍스트 채우는 순간 VRAM을 넘기면 시스템 램으로 오프로드되면서 TTFT가 0.1초 → 25초 이상으로 무너집니다. 대부분의 벤치마크 표는 1번만 보여주고 2번은 숨깁니다. 직접 돌려서 측정했습니다. 실측 환경 Apple M5 Max 128GB (MLX 런타임) 기준 측정 NVIDIA 카드 수치는 메모리 대역폭 기준 스케일 추정치 (방법론은 링크된 페이지에 명시) 2026년 10월 데이터 측정 결과 (일부) 모델 tok/s VRAM TTFT qwen3-coder:30b 146.2 18GB 4.3s gpt-oss:20b 102.9 13GB 14.2s llama3.1:8b 100.8 4.9GB 0.1s qwen3.6:35b-a3b 95.1 23GB 25.5s gemma4:26b MLX 88.1 52GB 0.1s qwen3.5:9b 73.0 6.6GB 0.1s 표에서 놓치면 안 되는 줄: gpt-oss:20b는 13GB라고 적혀 있지만 TTFT가 14.2초 입니다. 8K 컨텍스트 채우면 그 아래로 더 떨어집니다. "지원"과 "사용 가능"은 다른 말이에요. 카드별 판정표 내 카드에 그 모델이 fits / tight / offload인지 즉답 주는 페이지를 만들었습니다: VRAM Fit Matrix — 카드 선택, 모델 선택, 판정 확인. 함께 만든 실측표: 16GB에 도는 로컬 LLM 전부 실측 (EN) 10월 GPU 시세 + VRAM 1GB당 가격 순위 결론 16GB 카드면 컨텍스트 8K 전제에서 13GB 이하 모델, TTFT 1초 미만인 것들을 고르세요. 24GB(3090/4090 중고)가 체감상 가장 경제적입니다 — GB당 가격표 참고. 벤치마크 표 볼 때 tok/s 말고 TTFT/VRAM을 같이 달라고 하세요. 질문/교정 환영합니다. 측정 스크립트와 원시 데이터는 링크된 페이지에 있습니다.