Загружаем каталог…
Загружаем каталог…
첨부해주신 B300 8-GPU 검증 가이드 및 체크리스트 문서를 바탕으로, 내·외부 이해관계자 및 협업 팀에 현재 진행 중인 태스크의 전반을 명확하고 깔끔하게 공유할 수 있는 표준 개요 문서(Summary/Briefing Document)를 작성했습니다. [프로젝트 공유] B300 8-GPU 노드 무결성 및 인프라/추론 성능 검증 계획 문서 목적 : 신규 도입된 단일 NVIDIA B300 8-GPU 노드의 하드웨어 무결성 확보, Bare-Metal 환경 기준선(Baseline) 수립, 그리고 Kubernetes(K8s) 및 분산 인프라 연동 시 운영 안정성을 입증하기 위한 검증 체계·진행 상황 공유. 1. 검증 목적 (Objective) 하드웨어 무결성 및 신품 결함 여부 규명 : 최신 B300 아키텍처(PCIe Gen6, 4세대 NVSwitch, HBM, FP8/FP4 텐서코어)의 물리적 연결성 및 장시간 풀로드 시 안정성(쓰로틀링/XID/Row-Remap) 전수 확인. AI 서빙(vLLM) 기준 성능(Baseline) 도출 : Llama 3.1 70B/8B 및 DeepSeek-R1(FP8 MoE) 모델을 활용하여 서빙 지연(TTFT/ITL), 처리량, 동시성 포화점, Prefix Caching 및 KV 캐시 티어링(MemKV/로컬 NVMe) 효과 실측. 컨테이너/클러스터(K8s + Cilium) 환경 전이 손실 최소화 : Bare-Metal에서 측정한 성능 지표가 K8s 파드 및 CNI 환경에서도 구조적 병목 없이 유지되는지 확인하고, 정책(NetworkPolicy) 및 장애 복구 탄력성 검증. 회귀 게이트(Regression Gate) 구축 : 코드화된 기준( gate_criteria.yaml )을 통해 인수(Acceptance) 판정 자동화 및 향후 모델/드라이버 업그레이드 시 성능 저하(Drift)를 조기 감지하는 지속 운영 체계 수립. 2. 테스트 환경 요약 (Environment) 하드웨어 노드 : NVIDIA HGX B300 8-GPU 노드 (PCIe Gen6, 4세대 NVSwitch, NVLink 통신) 호스트 OS / 런타임 : Red Hat Enterprise Linux (RHEL) 10.2, NVIDIA Open Kernel Driver + Fabric Manager, Podman (CDI 인터페이스 적용) 네트워크 / 스토리지 : 100Gbps NIC (LACP 본딩, 유효 대역폭 50Gbps 환경, RDMA 미적용/TCP 기반) 초고속 로컬 엔터프라이즈 NVMe 캐시 어레이 ( /mnt/local-nvme-cache ) 대용량 모델 스토리지: MinIO AIStor / MemKV (S3 호환 엔드포인트) 컨테이너 인프라 : Kubernetes (Cilium CNI 기반 ClusterMesh 연동, GPU Operator, Hubble 관측성) 네트워크 제약 : 완전 폐쇄망(Air-gap) 환경 (사전 스테이징 PC에서 모델 safetensors, 이미지 tar, Python wheel 번들링 후 반입하여 HF_*_OFFLINE=1 강제 운영) 3. 검증 프레임워크 및 단계별 실행 구조 (Architecture & Steps) 검증은 초기 인수(Core Acceptance) 항목을 최우선으로 진행하며, 엔진 워밍업과 정상 상태 측정을 명확히 분리하여 계측의 신뢰성을 확보합니다. [0단계: Preflight] └─ 환경변수 단일화(validation_env.sh) & 호환성 검사(00_compatibility_check.sh) │ [1단계: Bare-Metal HW/인프라 무결성 검증] ├─ Stage 1: HW 무결성 (PCIe Gen6, Fabric Manager, NVLink All-Reduce, FP8/4 부하, gpu-burn 소크) ├─ Stage 2: 네트워크 & 로컬 스토리지 (LACP iperf3, Optic DDM, 200GB 지속 NVMe 쓰기/SMART) └─ Stage 2c (선택): MemKV Wire-level S3 Baseline (S3 PUT/GET 순수 대역폭) │ [2단계: 추론 서빙(vLLM) 성능 및 캐시 티어링 실증] ├─ Stage 3a: vLLM 기본 성능 (70B BF16 vs FP8, ITL 하한선 8B, DeepSeek-R1 MoE HBM 실증) ├─ Stage 3a-2~9 (선별): 동시성 포화점 탐색, RAG 가변 길이 곡선, Soak 테스트 └─ Stage 3a10: KV 캐시 티어링 실효성 비교 (GPU Native vs 로컬 NVMe vs 원격 MemKV) │ [3단계: K8s 클러스터 전이 및 운영 안정성 검증] ├─ Stage 6c / 6a: K8s GPU 토폴로지 및 파드 내 NCCL 재검증 (Bare-metal 대비 편차 확인) ├─ Stage 6b: 파드 간(Pod-to-Pod) 및 노드 네트워크 스루풋 재검증 ├─ Stage 6k: K8s vLLM Steady-State 재검증 (Performance-ready 마커 확인 후 지연/처리량 측정) └─ Stage 6h / 6i / 6f (부분): Cilium NetworkPolicy 격리, Hubble 가시성, 파드 복구(PDB/Probe) │ [4단계: 게이트 판정 및 요약 리포트] └─ regression_gate.py 자동 평가 (Hard Gate / Soft Warning) 및 종합 보고서 발행 ※ 초기 제외(Deferred) 범위 : 대규모 분산 학습(Stage 4), 대체 추론 엔진(Stage 3b Triton/TRT-LLM, 3c SGLang), Spark 대규모 동시 버스트(Stage 6d), 강제 파티션/경합(Stage 6g/6j)은 하드웨어 및 기본 vLLM 인수가 안정화된 이후 2단계로 진행합니다. 4. 핵심 판단 기준 (Pass / Fail Criteria) 판정은 시스템 결함을 의미하는 Hard Gate(배포 차단)와 최적화 검토 대상인 Soft Warning 으로 이원화하여 운영합니다. 영역 검증 항목 주요 판단 기준 (Pass Criteria) 실패/이상 시 대응 방안 하드웨어 (Stage 1) GPU 및 링크 인식 8장 전수 인식, PCIe Max=Current(Gen6 x16), Fabric Manager 활성 물리적 슬롯 재장착, BIOS ASPM 설정 점검, FM 서비스 재기동 메모리/통신 무결성 Uncorrected ECC = 0, 신규 XID 발생 0, NVLink 에러 0 발생 시 벤더사 RMA(교체) 즉시 요청 성능 및 스트레스 NCCL All-Reduce 이론치 80%+, gpu-burn 완주(DIED 0), 지속 쓰로틀 <1% 전원/발열 모니터링, Makefile CC 누락 여부 확인 네트워크/저장 (Stage 2) 본딩 네트워크 LACP x8 멀티스트림 ~45Gbps(이론치의 90%+), CRC/FEC 패킷 에러 0 LACP 해시 알고리즘(Layer 3+4) 및 광모듈 상태 확인 로컬 NVMe 캐시 200GB 연속 쓰기 후 급격한 성능 저하 없음, Media Error 0 드라이브 스펙(엔터프라이즈급 여부) 재확인, RMA 검토 추론 서빙 (Stage 3a) vLLM 70B 서빙 짧은 입력 ITL 5 8ms, FP8 적용 시 BF16 대비 TTFT 15~30% 단축 chunked-prefill 등 서버 파라미터 스윕, FP8 커널 점검 Prefix Caching 캐시 미적용 대비 TTFT 5~10배 단축 (목표: <50ms) 캐시 히트율 및 vLLM 메모리 사용률 재조정 KV 티어링 (Stage 3a10) none 대비 local_nvme / remote_obj 사용 시 동시성 확장(Capacity) 확보 지연시간 증가폭 대비 유효 동시성(Concurrency) 증가치로 효용 판단 K8s 연동 (Stage 6) 컨테이너 환경 전이 파드 내 NCCL, 네트워크 대역폭이 Bare-metal 대비 5~10% 이내 유지 CNI 오버헤드 확인, K8s Topology Manager 설정 점검 보안 및 격리 CiliumNetworkPolicy 미허가 트래픽 차단, Hubble 모니터링 정상 기록 네임스페이스 라벨링 및 L3/L4/L7 정책 룰 교정 5. 결과 활용 방안 및 향후 로드맵 (Utilization & Next Steps) 장비 인수 및 품질 보증 (Sign-off) 하드웨어 스트레스 및 무결성 로그를 바탕으로 신규 서버 벤더 검수 보고서 승인 근거 데이터로 활용. 사내 AI 워크로드 표준 서빙 스펙 수립 실측된 TTFT/ITL, 메모리 포화점 데이터를 기반으로 프로덕션 LLM 서비스(사내 RAG/Agent/챗봇)의 인프라 사이징 가이드라인 배포. 대규모 MoE(DeepSeek 등) 모델의 단일 노드 호스팅 가용성 및 파티셔닝 전략(TP=8 vs TP=4x2) 확정. CI/CD 및 지속 회귀 감시 (Regression Gate) 이번에 도출된 최적 결과를 baseline.json 으로 등록. 향후 vLLM, CUDA 드라이버, 베이스 OS 업데이트 시 동일 워크로드를 자동으로 돌려 5~10% 이상 성능 저하 발생 시 프로덕션 배포를 차단하는 게이트웨이로 연동. 추후 단계(Phase 2) 연계 분산 데이터 파이프라인(MinIO/Spark/Airflow) 결합 실시간 대규모 버스트 테스트(Stage 6d) 및 엔터프라이즈 Gateway(LiteLLM) 연동으로 확장.
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
26O05b. 첨부해주신 B300 8-GPU 검증 가이드 및 체크리스트 문서를 바탕으로, 내·외부 이해관계자 및 협업 팀에 현재 진행 중인 태스크의 전반을 명확하고 깔끔하게 공유할 수 있는 표준 개요 문서(Summary/Briefing Document)를 작성했습니다. [프로젝트 공유] B300 8-GPU 노드 무결성 및 인프라/추론 성능 검증 계획 문서 목적 : 신규 도입된 단일 NVIDIA B300 8-GPU 노드의 하드웨어 무결성 확보, Bare-Metal 환경 기준선(Baseline) 수립, 그리고 Kubernetes(K8s) 및 분산 인프라 연동 시 운영 안정성을 입증하기 위한 검증 체계·진행 상황 공유. 1. 검증 목적 (Objective) 하드웨어 무결성 및 신품 결함 여부 규명 : 최신…
Открыть источник