Загружаем каталог…
Загружаем каталог…
0. 용어정리 1) LLM 단계 단계 용어 쉽게 말하면 예시 1 Tokenization 문장을 token으로 쪼갬 "Explain HTTP" → 여러 token 2 Prompt 사용자가 LLM에게 넣는 입력 "Explain HTTP in one sentence." 3 Prefill 입력된 token들을 모델이 처리 질문을 "읽고 이해할 준비" 4 Decode 모델이 답변 token을 하나씩 생성 HTTP → is → a → ... 5 Response 생성된 token들이 모여 최종 답변이 됨 "HTTP is a protocol..." 2) 측정값 항목 의미 쉽게 이해하기 prompt_eval_count 입력 token 수 질문이 몇 token이야? prompt_eval_duration 입력 처리 시간 질문 처리하는 데 얼마나 걸렸어? eval_count 출력 token 수 답변을 몇 token 만들었어? eval_duration 출력 생성 시간 답변 만드는 데 얼마나 걸렸어? load_duration 모델 로딩 시간 모델을 메모리에 올리는 데 얼마나 걸렸어? total_duration 전체 처리 시간 처음부터 끝까지 얼마나 걸렸어? stream 출력 전달 방식 답변을 조금씩 받을까, 한꺼번에 받을까? tok/s 초당 token 생성량 1초에 답변을 몇 token 만들 수 있어? 1. 로컬 환경 GPU: RTX 3050 VRAM: 3926 MiB / 8192 MiB GPU Util: 5% Process: /llama-server 2. benchmark 1) thinking여부 실험 Model Tokens Decode Time Throughput Thinking Qwen3 4B 259 4.17s 62.1 tok/s Thinking Qwen3 4B 947 14.88s 63.6 tok/s Instruct Qwen3 4B Instruct 2 0.017s 짧아서 참고용 Instruct Qwen3 4B Instruct 200 3.19s 62.7 tok/s 2) Prefill + TTFT (길이별) Prompt 실제 입력 토큰 Prefill 출력 Decode 전체 짧음 15 28.2 ms 20 314.9 ms 392.3 ms 중간 76 338.8 ms 20 297.1 ms 650.9 ms 장문 194 92.2 ms 20 295.8 ms 405.4 ms -> 중간길이의 테스트가 장문보다 오래걸림. 좀더 확인요망 3) HTTP 설명 요청을 10회 보내서 LLM의 첫 응답까지 걸리는 시간과 전체 응답 시간, 생성 속도를 측정. 회차 TTFT 전체 응답 시간 출력 Token 생성 속도 1 30.24 ms 578.37 ms 37 67.62 tok/s 2 32.54 ms 587.84 ms 34 61.33 tok/s 3 31.46 ms 532.05 ms 34 68.01 tok/s 4 29.71 ms 609.03 ms 37 64.00 tok/s 5 27.92 ms 622.20 ms 37 62.35 tok/s 6 38.02 ms 555.61 ms 34 65.75 tok/s 7 24.88 ms 579.96 ms 34 61.33 tok/s 8 25.06 ms 592.20 ms 37 65.36 tok/s 9 28.55 ms 596.12 ms 37 65.30 tok/s 10 25.60 ms 528.41 ms 34 67.76 tok/s 전체요약 지표 평균 P50 P95 의미 TTFT 29.40 ms 29.13 ms 35.55 ms 첫 번째 출력까지 걸린 시간 전체 응답 시간 578.18 ms 583.90 ms 616.27 ms 요청부터 답변 완료까지 걸린 시간
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
이것저것 해보자 : 로컬 LLM. 0. 용어정리 1) LLM 단계 단계 용어 쉽게 말하면 예시 1 Tokenization 문장을 token으로 쪼갬 "Explain HTTP" → 여러 token 2 Prompt 사용자가 LLM에게 넣는 입력 "Explain HTTP in one sentence." 3 Prefill 입력된 token들을 모델이 처리 질문을 "읽고 이해할 준비" 4 Decode 모델이 답변 token을 하나씩 생성 HTTP → is → a → ... 5 Response 생성된 token들이 모여 최종 답변이 됨 "HTTP is a protocol..." 2) 측정값 항목 의미 쉽게 이해하기 prompt_eval_count 입력 token 수 질문이 몇 token이야?…