Загружаем каталог…
Загружаем каталог…
토큰/초만 보는 벤치마크는 오프로드 붕괴를 숨깁니다. TTFT(첫 토큰까지 시간)를 보세요. 왜 이 글을 쓰게 됐나 "16GB면 이 모델 돌아가나요?" 질문에는 정답이 두 개 있습니다. 로딩이 되느냐 — 가중치 파일 크기만 보면 답이 나옵니다. 실제로 쓸 만하느냐 — 컨텍스트 채우는 순간 VRAM을 넘기면 시스템 램으로 오프로드되면서 TTFT가 0.1초 → 25초 이상으로 무너집니다. 대부분의 벤치마크 표는 1번만 보여주고 2번은 숨깁니다. 직접 돌려서 측정했습니다. 실측 환경 Apple M5 Max 128GB (MLX 런타임) 기준 측정 NVIDIA 카드 수치는 메모리 대역폭 기준 스케일 추정치 (방법론은 링크된 페이지에 명시) 2026년 10월 데이터 측정 결과 (일부) 모델 tok/s VRAM TTFT qwen3-coder:30b 146.2 18GB 4.3s gpt-oss:20b 102.9 13GB 14.2s llama3.1:8b 100.8 4.9GB 0.1s qwen3.6:35b-a3b 95.1 23GB 25.5s gemma4:26b MLX 88.1 52GB 0.1s qwen3.5:9b 73.0 6.6GB 0.1s 표에서 놓치면 안 되는 줄: gpt-oss:20b는 13GB라고 적혀 있지만 TTFT가 14.2초 입니다. 8K 컨텍스트 채우면 그 아래로 더 떨어집니다. "지원"과 "사용 가능"은 다른 말이에요. 카드별 판정표 내 카드에 그 모델이 fits / tight / offload인지 즉답 주는 페이지를 만들었습니다: VRAM Fit Matrix — 카드 선택, 모델 선택, 판정 확인. 함께 만든 실측표: 16GB에 도는 로컬 LLM 전부 실측 (EN) 10월 GPU 시세 + VRAM 1GB당 가격 순위 결론 16GB 카드면 컨텍스트 8K 전제에서 13GB 이하 모델, TTFT 1초 미만인 것들을 고르세요. 24GB(3090/4090 중고)가 체감상 가장 경제적입니다 — GB당 가격표 참고. 벤치마크 표 볼 때 tok/s 말고 TTFT/VRAM을 같이 달라고 하세요. 질문/교정 환영합니다. 측정 스크립트와 원시 데이터는 링크된 페이지에 있습니다.
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
로컬 LLM 실행에 필요한 VRAM — 모델별 실측 매트릭스 (M5 Max 128GB). 토큰/초만 보는 벤치마크는 오프로드 붕괴를 숨깁니다. TTFT(첫 토큰까지 시간)를 보세요. 왜 이 글을 쓰게 됐나 "16GB면 이 모델 돌아가나요?" 질문에는 정답이 두 개 있습니다. 로딩이 되느냐 — 가중치 파일 크기만 보면 답이 나옵니다. 실제로 쓸 만하느냐 — 컨텍스트 채우는 순간 VRAM을 넘기면 시스템 램으로 오프로드되면서 TTFT가 0.1초 → 25초 이상으로 무너집니다. 대부분의 벤치마크 표는 1번만 보여주고 2번은 숨깁니다. 직접 돌려서 측정했습니다. 실측 환경 Apple M5 Max 128GB (MLX 런타임) 기준 측정 NVIDIA 카드 수치는 메모리 대역폭 기준 스케일 추정치 (방법론은 링크된…
Открыть источник