Loading the catalog…
Loading the catalog…
이 글은 NIA(한국지능정보사회진흥원) 디지털서비스 이슈리포트 2026-9호 에 기고한 리포트입니다. 📄 NIA 원문 · 브런치 (그림은 원문에서 볼 수 있습니다) 들어가며: 청구서가 먼저 온다 에이전트를 프로덕션에 올린 조직이 그다음 달에 가장 먼저 받아 드는 것은 거버넌스 대시보드가 아니라 청구서다. 지난 편에서 에이전트(스스로 계획을 세워 여러 단계를 실행하는 AI 프로그램)를 만드는 일은 쉬워졌고 남은 문제는 통제라고 정리했는데, 그 통제 문제가 실무에서 가장 먼저 비용의 형태로 드러난다. 에이전트는 한 번의 결과를 내놓기 위해 계획을 세우고, 도구를 호출하고, 돌아온 결과를 다시 읽고, 필요하면 처음으로 돌아가 다시 시도하는데, 이 과정이 쌓이면서 같은 일을 단발성 질의로 처리할 때보다 10배에서 30배에 이르는 토큰을 소비한다고 업계는 본다. 파일럿 시절에는 반올림 값이나 오차에 가까웠던 이 비용이 길지 않은 시간 후에 예산에서 별도 항목으로 관리해야 하는 상시 운영비가 되었다. 이 변화를 업계의 언어로 가장 선명하게 정리한 쪽은 공교롭게도 칩을 파는 회사였다. 엔비디아의 젠슨 황은 2026년 3월 GTC 2026 기조연설에서 데이터센터를 'AI 팩토리'로 재정의했는데, 투입되는 원료는 전기와 데이터이고 공장에서 나오는 완제품은 토큰이며, 생산성은 와트당 토큰으로 잰다는 것이다[1]. 칩 회사가 스스로를 토큰 생산 인프라 사업자로 설명하기 시작했다는 것은 토큰이 규격화된 원자재로 취급되기 시작했다는 뜻이고, 구매자의 언어로 옮기면 추론은 이제 기술 선택의 문제이기 이전에 조달의 문제가 되었다는 것이다. 가트너는 2026년 8월 전망에서 AI에 최적화된 인프라 서비스(IaaS) 지출이 2026년 423억 달러로 전년 대비 96% 늘고, 그 가운데 추론이 233억 달러로 학습의 190억 달러를 처음 넘어서 전체의 55%를 차지할 것으로 내다봤다[2]. 기업의 예산 편성에서도 같은 흐름이 확인되는데, a16z는 기업 CIO 100명을 조사해 기업 한 곳의 평균 대규모 언어 모델(LLM) 예산이 2025년 700만 달러에서 2026년 말 1,160만 달러로 늘어날 것으로 전망했다[3]. 이번 리포트는 그 토큰을 '사는 쪽'의 이야기다. 추론 산업은 세 개의 층으로 쌓여 있고, 이 글은 CIO와 CTO가 실제로 지갑을 여는 맨 위층을 다루며, 공장을 '짓는 쪽'의 사정은 다음 편에서 이어진다. 이번 보고서에서의 질문은 다음의 셋이다. 1) 어디서 살 것인가, 2) 어떤 방식으로 살 것인가, 그리고 3) 얼마에 살 것인가. 그런데 2026년의 조직은 이 셋을 한 번 정해 두고 끝내지 못하는데, 애플리케이션이나 에이전트가 모델을 호출할 때마다 셋을 다시 판단하는 일을 사람 대신 소프트웨어가 맡기 시작했기 때문이다. 이 질문들에 답할 수 있는 상태, 곧 무엇을 얼마나 쓰는지 알고 필요하면 갈아탈 수 있는 상태를 이 글은 구매 역량이라 부르고, 그 역량을 어떻게 갖출 것인가로 글을 정리한다. 토큰은 어디서 와서 어떻게 팔리는가 토큰이 오는 곳, 세 개의 층 맨 아래층은 AI 데이터센터로, 부지와 전력을 갖춘 사업자와 그 위에 GPU를 놓고 연산 시간을 파는 사업자를 합쳐 부르는 이름이며 공장에 비유하자면 건물과 설비다. 그 위의 추론 인프라는 같은 GPU에서 더 많은 토큰을 뽑아내는 서빙 엔진과 최적화의 층이고 생산 라인에 해당한다. 맨 위의 토큰 팩토리는 완제품인 토큰을 API로 판매하는 층이며, 엔비디아가 AI 팩토리라 부르는 것이 세 층을 합친 전체라면 이 글의 토큰 팩토리는 그 맨 위층만을 가리킨다. 세 층은 회사의 경계라기보다 기능의 경계여서 한 회사가 두 층을 품기도 하고, 구매자가 GPU를 직접 두고 오픈 모델을 돌리는 셀프호스트 방법으로 가운데 층을 스스로 떠안기도 한다. 그리고 이 세 층으로 쌓인 구조의 맨 위에는 모델을 호출할 때마다 어느 공급자에게서 살지를 고르는 구매 데스크가 새로 얹어진다. 이 세 층은 가동률을 기준으로 한 지점에서 만난다. 데이터센터의 자본 지출은 그 자체로는 비용일 뿐이고 추론 인프라가 GPU를 쉬지 않고 돌려 토큰으로 바꿔낼 때에만 매출이 되는데, 그래서 이 산업의 마진은 GPU 시간을 빌려주는 아래층보다 토큰을 파는 위층에서 커질 수 있다. 하지만, 그것은 가동률을 채웠을 때에만 실현되는 잠재적 마진이고 커모디티화(어디서 사든 같은 물건이 되어 가격으로만 경쟁하게 되는 것)의 압력이 그 마진을 계속 깎아내린다. 구매자에게 이는 선택지로 여겨지는데, 토큰을 사면 GPU가 쉬든 말든 신경 쓸 일이 없는 대신 남의 마진을 함께 지불하고, GPU 시간을 사면 마진을 줄이는 대신 가동률을 스스로 책임져야 한다. 세 가지 구매 모드: 택시, 대절 버스, 자가용 실무에서 추론을 사는 방식은 크게 셋이며, 탄 만큼 내는 택시(서버리스 API)와 시간당 빌리는 대절 버스(전용 엔드포인트), 사서 직접 모는 자가용(셀프호스트)에 해당한다. 셋을 가르는 것은 무엇을 남에게 맡기고 무엇을 직접 지느냐인데, 다만 택시에도 분당 토큰 한도라는 사실상의 용량 계약이 붙는다. 표 1: 세 가지 구매 모드 비교(칸의 값은 대표적인 경우이며 사업자와 리전에 따라 다르다) 구분 서버리스 API 전용 엔드포인트 셀프호스트 비유 탄 만큼 내는 택시 시간당 빌리는 대절 버스 사서 직접 모는 자가용 과금 단위 토큰당 GPU 시간당 GPU 구매·임대 + 운영 인건비 지연 가변 안정 튜닝에 따라 최적화 가능 처리량 유연 보장 자체 용량 한도 내 자유 모델 선택 제공 목록 한정 제공 목록 + 커스텀 모델 반입 오픈 모델 전면 자유 데이터 주권 낮음~중간 중간 완전 관리 부담 최소 낮음 높음 세 모드 사이의 경계선을 긋는 것이 가동률(확보한 처리량 대비 실제로 쓴 처리량)이다. 서버리스와 전용 엔드포인트의 손익분기점은 대체로 GPU 가동률 40 50% 부근에 놓인다는 분석이 있고[4], 셀프호스트는 GPU 임대 원가만 놓고 보면 응답 속도 요구에 따라 22 48% 구간에서 손익이 갈리지만[5] 운영 비용을 얹으면 그 경계는 위로 올라간다. 같은 분석은 거의 유휴 상태인 셀프호스트 GPU가 서버리스보다 2~4배 비쌀 수 있다고 계산하는데[5], 그 차이는 인건비와 피크에 맞춰 확보해 두는 유휴 용량에서 온다. 사실상의 표준이 된 vLLM과 프리픽스 재사용 구조(RadixAttention)로 이름을 알린 SGLang 같은 오픈소스 서빙 엔진이 진입 문턱을 낮추기는 했지만, 양자화 수준을 정하고 병렬 구성과 문맥 캐시(KV 캐시) 메모리를 조정하고 장애를 복구하는 일에는 여전히 전담 인력이 필요하다. 이 경계는 어느 서버리스 단가와 견주느냐에 따라서도 크게 달라진다. 같은 오픈 모델을 여러 사업자가 동시에 서빙하는 구조가 자리 잡으면서, 널리 쓰이는 한 오픈 모델을 기준으로 최저가 사업자와 최고가 사업자의 100만 토큰당 단가는 8배 넘게 차이가 난다. 초당 생성 속도 역시 사업자마다 크게 다른데, 단가와 속도가 비례하지 않아서 가장 빠른 사업자가 가장 비싼 사업자는 아니다[6]. 단가표의 한 줄도 들여다보면 입력과 출력, 캐시 적중, 긴 문맥 구간에 따라 요금이 나뉘고, 사고 단계를 거치는 추론(reasoning) 모델은 화면에 보이지 않는 사고 토큰까지 출력 요금으로 청구한다. 구매자가 고를 여지가 이만큼 넓다는 사실이 다음 절의 구매 데스크가 존재하는 이유다. 구매 데스크: 호출마다 공급자를 고르는 층 같은 상품의 가격이 8배 넘게 벌어져 있다면, 모든 호출을 최상위 모델로 보내는 것은 모든 출장을 일등석으로 보내는 일과 다르지 않다. 그래서 애플리케이션과 모델 사이에 새로운 층이 끼어들었는데, 호출이 일어날 때마다 이번 토큰은 어느 공장에서 살지를 자동으로 결정하는 계층이며 앞의 층 위에 놓인 구매 데스크라 부를 만하다. 이런 자동 선택이 편의 못지않게 위험도 가져온다는 사실은 2025년 8월 오픈AI의 GPT-5 출시가 보여 줬다. 오픈AI는 챗GPT에서 쉬운 질의는 소형 모델로, 어려운 질의는 대형 모델로 보내는 실시간 라우터를 기본값으로 켰는데(API에서는 사용자가 세 가지 크기의 모델을 직접 고른다[7]), 초기 라우팅이 제대로 작동하지 않으면서 복잡한 질의까지 소형 모델로 흘러갔고 새 모델이 오히려 퇴보했다는 반발이 일자 이전 모델의 선택지를 되살리는 것으로 대응했다[8]. 소비자 제품에서 먼저 벌어진 이 일은 관리형 라우팅을 사려는 기업에서도 그대로 되풀이될 수 있는데, 내 질의를 무엇이 처리했는지 모르는 상태에서는 품질 저하를 진단할 수도 책임을 물을 수도 없다. 이 편의와 위험을 함께 다루는 상품은 세 갈래로 나뉜다. 품질과 비용 사이의 다이얼을 사용자에게 넘기는 독립 게이트웨이, 라우팅을 기본 기능으로 흡수한 하이퍼스케일러, 그리고 GPT-5처럼 라우팅을 제품 안에 넣어 소비자가 모델 대신 결과의 품질 등급을 사게 하는 모델 벤더다. 앞의 두 갈래는 다음 장의 오픈라우터 절과 AWS 베드록·마이크로소프트 파운드리 절에서 본다. 시장이 라우팅을 상품으로 팔아 온 동안, 학계는 같은 문제를 공개된 연구 과제로 다뤄 왔다. 값싼 모델부터 시도하는 캐스케이드 방식을 처음 정식화한 프루갈GPT(FrugalGPT, 2023)에서 2026년의 LLM라우터(LLMRouter)까지, 개별 기법이 표준 벤치마크를 거쳐 통합 라이브러리로 수렴했다. 학습된 라우터가 성능 지표에서 최강의 단일 고정 모델보다 상대적으로 14.6% 나은 결과를 냈다는 LLM라우터의 보고는[9], 비용과는 별개로 모델마다 잘하는 질의가 달라 조합이 단일 최강 모델을 이길 수 있다는 뜻이다. 라우팅은 특정 업체의 비밀로 남지 않는 표준화 가능한 학습 문제이며, 자사의 질의 분포와 그 위의 품질 판정 데이터로 직접 학습시켜 내재화할 수 있는 역량이기도 하다. 라우팅 기술이 그렇게 범용화되는 동안 구매 데스크라는 자리는 오히려 비싸졌다. 팔로알토 네트웍스는 게이트웨이 스타트업 포트키(Portkey)를 인수해 자사 보안 플랫폼의 통제점으로 삼았고[10], 스트라이프(Stripe)는 2026년 8월 오픈라우터(OpenRouter) 인수에 합의했는데 보도된 가격은 70억 달러 이상으로 석 달 전 기업가치의 5배가 넘는다[11]. 라우팅의 값은 기술이 아니라 그 자리에 매겨지고 있는 셈이다. 여기서 한 가지 질문이 남는데, 스위치 하나로 수요가 공장 사이를 즉시 옮겨 다닐 수 있고 그 스위치를 만드는 기술마저 오픈소스로 풀려 있다면, 토큰을 만들어 파는 쪽에는 무엇이 남는가. 다음 장의 여섯 벤더는 각자의 방식으로 이 질문에 답하는 중이다. 주요 벤더별 솔루션 심층 분석 이 영역의 주요 플레이어인 여섯 벤더를 가치사슬의 위치 순서로 살펴본다. 독립 추론 클라우드, 전용 실리콘 진영, 구매 데스크, 하이퍼스케일러의 순이며, 각 벤더가 커모디티화의 압력 앞에서 무엇을 해자로 내세우는지에 초점을 맞춘다. 파이어웍스 AI: 속도에 값을 매기다 독립 추론 클라우드인 파이어웍스 AI(Fireworks AI)는 속도를 해자로 삼는 전략의 가장 성공한 사례다. 회사에 따르면 2026년 7월 연간 반복 매출이 10억 달러를 넘겼고 하루에 처리하는 토큰은 40조 개를 넘는다[12]. 커서·노션·쿼라·버셀 같은 고객 명단이 파이어웍스의 위치를 잘 보여 주는데[13], 코드 편집기와 문서 도구처럼 사용자가 응답을 기다리는 시간이 곧 제품 품질인 회사들이다. 기술의 중심에는 자체 개발한 어텐션 커널 파이어어텐션(FireAttention)이 있고, 그 위에 같은 GPU에서 토큰 산출을 높이는 최적화 기법들이 쌓여 있다. 회사는 이 커널의 FP8 구현이 오픈소스 엔진 vLLM보다 4배 빠르다고 밝혀 왔고[14], 고객인 노션은 응답 지연을 약 2초에서 350밀리초로 줄였다고 말한다[13]. 서버리스 외에 전용 엔드포인트와 온프레미스 배포까지 세 가지 구매 모드를 모두 갖췄고, 2026년에는 마이크로소프트 파운드리 안에서 정식 서비스로 제공되기 시작해 독립 추론 클라우드가 하이퍼스케일러의 계약과 청구서 안으로 들어간 드문 사례가 됐다. 속도에는 값이 붙는다. 파이어웍스의 서버리스 단가는 16B 초과 모델 기준 100만 토큰당 0.90달러로, 최저가 사업자의 0.12달러와 견주면 7.5배에 이르러[15][6], 밤새 돌리는 배치 요약처럼 속도가 필요 없는 워크로드에는 과잉이고, 양자화 수준과 캐싱 옵션이 많아 최적의 조합을 찾는 데에도 학습 비용이 든다. 빠른 토큰은 아직 원자재가 되지 않았다는 것이 파이어웍스의 주장이고, 응답 속도가 곧 제품 품질인 워크로드에서만 그 값을 치를 이유가 있다. 투게더 AI: 백화점이 공장을 갖기 시작할 때 투게더 AI(Together AI)는 오픈소스 모델 생태계의 백화점을 자처한다. 폐쇄형 API보다 크게 저렴하다는 것을 정면에 내세우고, 수백 개의 오픈 모델을 서빙하는 카탈로그 위에 파인튜닝 서비스와 전용 GPU 클러스터까지 잇는 스펙트럼을 갖췄으며, 회사는 2026년 7월 기준 수주 잔고가 11억 5,000만 달러이고[16], 8월에는 월간 처리 토큰이 400조 개에 이른다고 밝혔다[17]. 2026년 7월의 투자 유치 발표에서 눈여겨볼 숫자는 따로 있는데, 투게더가 확보했다고 밝힌 500메가와트(업계는 확보한 계산 능력을 전력 용량으로 센다)의 커밋 컴퓨트다[18]. 위층의 마진은 가동률로만 지켜지므로 투게더는 가동률의 근원인 공급을 잡으러 가치사슬 아래로 내려간 것이고, 2026년 8월에는 IBM 클라우드에 추론 전용 GPU 클러스터를 두는 2억 4,000만 달러 규모의 다년 계약을 맺어 남의 공장까지 빌린 셈이다[17]. 투게더가 내세우는 것은 규모의 경제와 파인튜닝인데, 플레이그라운드에서 모델을 비교하다 같은 화면에서 파인튜닝 작업을 시작하는 흐름이 사용자 경험의 강점이다. 반면 위와 아래에서 동시에 압력을 겪는데, 위로는 폐쇄형 최상위 모델이 없으므로 오픈 모델로 충분한지를 검증하는 일이 고객의 몫이고, 아래로는 자체 GPU를 직접 운영해 단가로 경쟁하는 사업자들이 있어 오픈 모델끼리 견주면 투게더는 오히려 비싼 축에 속한다. 6~20배 저렴하다는 회사의 주장은 폐쇄형 모델과 견줄 때의 이야기다[18]. 그록과 세레브라스: GPU에서는 나오지 않는 속도 GPU 대신 전용 실리콘으로 토큰을 만드는 이 두 회사가 내세우는 것은 클러스터 전체의 처리량보다 요청 하나가 체감하는 속도, 곧 첫 토큰이 나오기까지의 지연과 그 뒤의 생성 속도다. 토큰을 하나 만들 때마다 모델 가중치 전체를 메모리에서 읽어야 하므로 생성 단계는 연산보다 메모리 대역폭에 묶이는데, 두 회사는 가중치를 GPU의 외장 메모리(HBM) 대신 칩 위의 SRAM에 두어 이 병목을 피한다. 그록(Groq)의 LPU는 실행 순서가 미리 정해져 대기 시간이 없는 구조로 소형·중형 모델에 특화되어, 독립 벤치마크 기준 널리 쓰이는 70B급 오픈 모델을 초당 300토큰 이상으로 생성해 GPU 기반 사업자의 속도를 큰 차이로 앞선다[6]. 실시간 에이전트나 음성 대화처럼 응답이 몇백 밀리초만 늦어져도 제품으로서 실패하는 워크로드가 그록의 영역이다. 세레브라스(Cerebras)는 같은 원리를 훨씬 큰 칩에 적용한다. 웨이퍼 하나를 통째로 칩으로 쓰는 WSE-3는 GPU의 칩 내장 메모리보다 수백 배 큰 SRAM을 갖춰 405B급 초대형 모델까지 초당 900토큰 넘게 생성한다. 회사는 2026년 5월 나스닥에 상장해 55억 달러 안팎을 조달했고[19], 8월에 발표한 2분기 실적에서 클라우드 부문 매출이 전년 동기 대비 4배 가까이 늘었다고 밝혔으며[20], 오픈AI와는 750메가와트 규모, 200억 달러 이상의 다년 공급 계약을 맺었다[21]. 반면 두 회사는 같은 값을 치르는데, 가중치를 SRAM에 담아야 하므로 큰 모델일수록 칩 수가 급증하고 새 모델을 올릴 때마다 포팅 비용이 들어 모델 커버리지가 GPU 사업자보다 좁으며, 공급 능력이 수요를 따라가지 못하는 시기가 반복된다. 그러나 다이얼을 아무리 돌려도 GPU에서는 나오지 않는 속도가 있고, 그 속도의 값을 가장 크게 매긴 쪽은 GPU 회사 자신이었는데, 엔비디아는 2025년 12월 그록 추론 기술의 비독점 라이선스를 보도에 따르면 약 200억 달러에 사들이고 창업자 조너선 로스를 포함한 핵심 인력을 데려갔으며, 그록은 독립 회사로 남아 GroqCloud를 계속 운영하고 있다[22]. 오픈라우터: 결제 회사가 산 구매 데스크 오픈라우터는 여섯 벤더 가운데 유일하게 GPU가 없다. 400개가 넘는 모델과 80곳이 넘는 공급자를 오픈AI 호환 단일 API 뒤에 모아 놓고, 공급자의 토큰 단가는 그대로 넘기되 크레딧을 결제할 때 5.5%의 수수료를 얹는다[23]. 앞에서 언급한 공장이 아니라 대표적인 구매 데스크이며, 2026년 5월 기준 사용자는 800만 명, 처리량은 월 100조 토큰으로 6개월 만에 5배가 됐다[24]. 그리고 2026년 8월, 결제 회사 스트라이프가 이 구매 데스크를 사기로 합의했다[11]. 핵심 기능은 폭넓은 모델 선택지, 한 공급자가 장애를 일으키면 자동으로 다른 공급자로 넘기는 폴백, 그리고 품질과 비용 사이의 다이얼을 사용자에게 넘기는 자동 라우터다. 구매 데스크에 서면 시장 전체가 보인다는 점도 오픈라우터만의 자산인데, 회사가 공개하는 사용 통계에 따르면 프로그래밍 워크로드가 2025년 초 전체 토큰의 11%에서 연말에는 절반 이상으로 늘었고[25], 2026년 2월에는 중국 모델이 주간 토큰 처리량에서 미국 모델을 처음 앞질러 6월 기준 라우팅된 토큰의 46%를 차지했다[26]. 반면 구매 데스크라는 위치의 약점은 그대로다. 사용량이 커진 고객은 볼륨 할인과 약정 요금을 얻기 위해 공급자와 직접 계약하려 하고, 라우팅 기술은 오픈소스로 풀려 있어 자체 구축이 가능하며, 감사 로그와 예산 통제 같은 엔터프라이즈 거버넌스 기능은 아직 성숙 중이다. 그렇다면 스트라이프는 무엇을 산 것인가. 오픈라우터의 수수료가 결제할 때 붙는다는 사실이 답의 절반이고, 스트라이프의 패트릭 콜리슨이 인수 발표에서 "토큰은 AI로 제품을 만드는 회사들의 중심 통화"라고 말한 것이 나머지 절반이라 할 수 있다[11]. 오픈라우터의 창업자는 자사를 'AI의 스트라이프'라 불렀는데, 스트라이프가 산 것은 라우팅 기술이라기보다 800만 사용자가 토큰을 결제하는 계산대이고, 구매 데스크의 자리가 그 자리에 서 있는 기술보다 비싸다는 것이 이 거래의 뜻이다. AWS 베드록: 이미 맺어 둔 계약이라는 자산 이전 보고서에서 베드록 에이전트코어를 에이전트 실행 인프라로 다뤘다면, 이번에 보는 것은 같은 베드록의 아래층, 곧 토큰을 파는 층이다. AWS의 관리형 추론 서비스인 베드록(Bedrock)은 수백 개의 파운데이션 모델을 단일 API로 제공하며, 아마존에 따르면 12만 5,000곳이 넘는 고객과 포춘 100대 기업의 약 80%가 이용한다[27]. 이미 체결된 AWS 계약과 IAM 권한, VPC 경계, 규정 준수 인증, 곧 심사가 끝난 보안 울타리 안에서 토큰을 산다는 것은 조달 부서와 보안 부서에 새 벤더를 심사하는 절차를 통째로 생략해 준다는 뜻이기도 하다. 구매 모드의 관점에서 베드록은 세 요금제를 한 제품 안에서 다룬다. 토큰당 과금하는 온디맨드, 지연을 감수하는 대신 업계 관행대로 절반 가격인 배치 추론, 처리량을 약정하고 그 용량을 채워 쓰면 30 50%를 절감하는 프로비저닝 처리량이 그것이며, 앞의 가동률 논의를 벤더를 바꾸지 않고 요금제만 바꿔 따라갈 수 있게 한 것이다. 라우팅도 안으로 흡수했는데, 2025년 4월 정식 출시된 지능형 프롬프트 라우팅(Intelligent Prompt Routing)은 요청별로 응답 품질을 예측해 같은 모델 계열 안에서 크기가 다른 모델을 오가며, AWS에 따르면 내부 테스트에서 계열에 따라 16 56%의 비용 절감을 보였다[28]. 반면 심사가 끝난 울타리 안에 머무는 대가는 선택의 제한이다. 새 모델이 시장에 나온 뒤 베드록 카탈로그에 오르기까지 시차가 있고, 라우팅은 같은 계열 안에서만 작동하므로 계열을 넘는 선택은 여전히 사람의 몫이며, 모델별 단가가 AWS 정가로 고정되어 있어 사업자 간 8배가 넘는 단가 격차는 이 울타리 안으로 들어오지 않는다. 베드록을 붙드는 것은 토큰의 값보다 이미 맺어 둔 계약이며, 그것은 구매자 입장에서 가장 경계해야 할 종류의 편의이기도 하다. 마이크로소프트 파운드리: 유통망이 된 애저 마이크로
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
2026 클라우드 솔루션 리포트 (9) — 추론 인프라 (1) 토큰 경제. 이 글은 NIA(한국지능정보사회진흥원) 디지털서비스 이슈리포트 2026-9호 에 기고한 리포트입니다. 📄 NIA 원문 · 브런치 (그림은 원문에서 볼 수 있습니다) 들어가며: 청구서가 먼저 온다 에이전트를 프로덕션에 올린 조직이 그다음 달에 가장 먼저 받아 드는 것은 거버넌스 대시보드가 아니라 청구서다. 지난 편에서 에이전트(스스로 계획을 세워 여러 단계를 실행하는 AI 프로그램)를 만드는 일은 쉬워졌고 남은 문제는 통제라고 정리했는데, 그 통제 문제가 실무에서 가장 먼저 비용의 형태로 드러난다. 에이전트는 한 번의 결과를 내놓기 위해 계획을 세우고, 도구를 호출하고, 돌아온 결과를 다시 읽고, 필요하면 처음으로 돌아가 다시…
Open source