위클리 로컬LLM — 27B 5.9GB 초저비트와 84GB RTX PRO가 로컬 메모리 지형을 바꾼 주 조사 범위: 2026년 9월 14일~21일. 이번 주는 단순히 더 큰 모델이 나온 주라기보다, 같은 모델을 훨씬 작은 메모리에 넣는 방향과 한 대에 안 들어가는 모델을 여러 노드로 나누는 방향이 동시에 진전됐습니다. 이번 주 핵심 3줄 * PrismML의 Bonsai 2 27B는 Qwen3.8 27B 기반 dense 모델을 1.76bit급 ternary로 압축해 5.9GB까지 줄였습니다. 다만 일반 GGUF처럼 아무 llama.cpp에서 바로 돌리는 단계는 아니며 전용 런타임 지원이 필요합니다. * NVIDIA는 RTX PRO 5500 84GB GDDR7이라는 새 단일 GPU 메모리 구간을 만들었습니다. 1.398TB/s 대역폭은 강력하지만 최대 600W이고 가격도 아직 확정되지 않아 가성비보다 ‘한 장에 얼마나 넣을 수 있느냐’가 핵심입니다. * AMD는 Ryzen AI Halo 여러 대를 묶는 vLLM+RCCL 2노드, llama.cpp RPC 4노드 경로를 공식 문서화했습니다. 핵심은 속도 2배가 아니라 한 대에 안 들어가는 초대형 모델을 소비자급 노드 여러 대로 실행할 수 있는 확장 경로가 명확해졌다는 점입니다. 최신 모델·VLM 변화 가장 중요한 신모델은 9월 17일 공개된 Ternary Bonsai 2 27B입니다. 27.8B dense 모델이며 MoE의 ‘활성 파라미터가 적어서 가벼운’ 방식이 아닙니다. 실제 270억 개가 넘는 가중치를 {-1, 0, +1} ternary와 FP16 그룹 스케일로 저장해 5.9GB까지 내렸습니다. 262K context와 이미지 입력도 지원합니다. PrismML은 원본 Qwen3.8 27B 대비 종합 벤치마크 성능 98.2%, RTX 5090에서 최대 143tok/s를 주장하지만 둘 다 제조사 실측입니다. 독립 재현 데이터는 아직 충분하지 않습니다. 여기에는 중요한 함정이 있습니다. PTQ1_0/PQ2_0이라는 새 형식과 Hadamard 변환을 사용하기 때문에 현재 stock llama.cpp는 이를 인식하지 못합니다. PrismML 계열 llama.cpp 또는 해당 형식을 지원하는 별도 런타임이 필요합니다. 따라서 이번 변화는 단순한 ‘Q2보다 더 작은 양자화’라기보다 모델 구조·가중치 표현·커널을 함께 설계하는 초저비트 추론의 사례로 보는 편이 정확합니다. VLM 쪽에서는 9월 17일 Tencent의 WeVisDoc-2B/4B가 공개됐습니다. Qwen3-VL을 기반으로 문서 이미지를 Markdown·LaTeX·HTML 표로 직접 변환하는 전문 VLM이며, 4B 모델은 제작진 평가에서 OmniDocBench v1.6 95.38을 기록했습니다. 범용 VLM을 무조건 키우기보다 2~4B급 모델을 특정 시각 업무에 강하게 특화하는 흐름입니다. 수치는 논문·모델 제작진 기준이므로 독립 실측과는 구분해야 합니다. 영상 VLM은 이번 7일 동안 로컬 하드웨어 기준을 다시 쓸 만큼 큰 오픈웨이트 변화는 확인되지 않았습니다. 그 변화가 요구하는 하드웨어 Bonsai 2 때문에 ‘파라미터 수만 보고 필요한 VRAM을 추정하는 법’이 더 부정확해졌습니다. 27B인데 약 6GB일 수도 있고, 일반 Q4 27B는 16GB 이상일 수도 있습니다. 앞으로는 파라미터 수와 함께 실제 bpw, 런타임 지원, KV cache, vision encoder 메모리를 따로 봐야 합니다. [추정] 현재 기준으로 16GB는 새 ternary 27B나 28B급 VLM에는 상당히 넉넉해졌지만 범용 27B 고품질 양자화에는 여전히 빠듯합니다. 2432GB는 일반적인 2735B와 로컬 agent 운용의 실용 구간, 4864GB는 70B급 Q4/Q5와 긴 context, 8496GB는 70B 고비트 또는 100B급 저비트 모델이 현실적인 영역입니다. 128192GB는 100~300B급 저비트·MoE를 한 시스템에서 다루는 쪽으로 이동하고 있습니다. 다만 모델 파일이 들어간다는 것과 긴 context에서 빠르게 동작한다는 것은 별개입니다. 특히 VLM은 언어 모델 외에 vision encoder와 이미지 토큰이 추가됩니다. WeVisDoc처럼 작은 4B 모델도 고해상도 페이지를 여러 장 넣거나 context를 크게 늘리면 가중치보다 attention·KV 메모리 비중이 커질 수 있습니다. BF16/FP8을 잘 처리하는 최신 GPU와 Flash Attention 계열 커널 지원 여부가 텍스트 전용 모델보다 중요합니다. 주요 신형 머신·가속기 NVIDIA RTX PRO 5500 Blackwell은 84GB ECC GDDR7과 1,398GB/s 메모리 대역폭을 제공합니다. 최대 소비전력은 600W입니다. 32GB 소비자 GPU와 96GB급 최상위 전문가 GPU 사이에 처음으로 꽤 큰 84GB 단일 카드 구간이 생겼다는 의미가 큽니다. 공식 가격은 아직 공개되지 않았으므로 지금 단계에서 ‘가성비가 좋다’고 평가할 근거는 없습니다. AMD 쪽은 Ryzen AI Max+ PRO 495가 192GB LPDDR5X 통합 메모리를 지원하며, AMD는 최대 160GB를 그래픽 메모리로 배정해 4bit 기준 300B+ 모델을 구동할 수 있다고 설명합니다. 이는 제조사 용량 주장이지 실제 속도 보장은 아닙니다. 45~120W APU라는 점에서 RTX PRO와 전력 특성은 완전히 다르지만, 메모리 대역폭 역시 GDDR7 워크스테이션 GPU보다 훨씬 낮습니다. 이번 주에는 중국 SIXUNITED의 192GB 노트북 레퍼런스와 CHUWI의 192GB 미니 워크스테이션도 공개됐습니다. 중요한 것은 ‘노트북이냐 미니PC냐’가 아니라 192GB Halo 플랫폼이 실제 OEM 제품군으로 확산되기 시작했다는 점입니다. 지속 부하에서는 냉각 설계와 전력 제한에 따라 같은 APU라도 실제 tok/s가 크게 달라질 수 있습니다. AMD Halo 멀티노드: 여러 대를 묶으면 무엇이 달라지나 AMD가 공식 제공하는 2노드 가이드는 Ryzen AI Halo 두 대에 10GbE 스위치를 연결하고, Ray+vLLM+RCCL을 사용해 Qwen3.5-397B-A17B GPTQ Int4를 tensor parallel 2로 나눠 실행합니다. 각 노드의 공유 메모리는 Linux TTM 설정으로 120GB까지 GPU가 접근하도록 구성합니다. AMD 문서에는 4노드까지 늘리고 tensor-parallel-size를 증가시키는 방법과 MoE용 expert parallel도 안내돼 있습니다. 여기서 128GB 두 대가 물리적인 256GB 통합 VRAM 한 덩어리가 되는 것은 아닙니다. 모델 텐서가 노드별 메모리에 나뉘어 저장되고, 추론 과정에서 네트워크를 통해 결과를 계속 교환합니다. vLLM tensor parallel은 특히 토큰을 계산할 때 노드 간 동기화가 반복되므로 네트워크 지연과 대역폭 영향을 크게 받습니다. AMD가 2노드 RCCL 예제에서 10GbE를 명시한 이유입니다. 1GbE의 이론 최대 전송률은 약 0.125GB/s, 2.5GbE는 0.31GB/s, 10GbE는 1.25GB/s이므로 1~2.5GbE는 대형 tensor parallel에서 쉽게 병목이 됩니다. 반면 AMD의 이전 4노드 llama.cpp RPC 예제는 Ryzen AI Max+ 395 128GB 네 대와 5GbE를 사용해 375GB짜리 Kimi K2.5 UD_Q2_K_XL을 분산했습니다. AMD 실측에서 8K context의 생성 속도는 Flash Attention 사용 시 8.30tok/s였고 TTFT는 8K prompt에서 90.5초였습니다. 즉 ‘된다’는 의미는 매우 크지만, 네 대를 묶었다고 단일 노드 대비 네 배 빨라지는 구조는 아닙니다. 따라서 Halo 클러스터의 의미는 성능 스케일링보다 용량 스케일링입니다. 랩탑·미니PC라는 외형보다 ROCm 호환성, 충분한 통합 메모리, 10GbE 이상 네트워크, 그리고 장시간 부하에서 클럭을 유지할 냉각이 중요합니다. SGLang 역시 일반적인 분산 TP/EP 기능을 갖고 있지만, 이번에 확인한 AMD 공식 Halo 예제는 vLLM/RCCL과 llama.cpp RPC이며 SGLang의 Halo 공식 검증 사례는 확인되지 않았습니다. 런타임·지원 변화 llama.cpp는 9월 15일 Vulkan 백엔드에 DSV4/GLM 계열 sparse Flash Attention 지원을 추가했습니다. CUDA만이 아니라 Vulkan 경로에서도 최신 sparse/hybrid 모델 최적화가 점차 따라오는 흐름입니다. Apple Silicon에서는 변화가 더 큽니다. LM Studio 0.4.25가 9월 19일 Splash 엔진을 추가했습니다. Qwen3.8-27B와 Qwen3.6-35B-A3B 전용 Metal 커널과 DFlash2 speculative decoding을 결합하며, 제작사 측 실측으로 M5 Pro 48GB에서 Qwen3.8-27B가 짧은 prompt 기준 약 74tok/s, 32K context에서 54tok/s를 기록했습니다. M3 이상·macOS 26.4 이상·최소 36GB 통합메모리가 필요합니다. 수치는 아직 독립 실측이 아니라 Inco/LM Studio 측 결과입니다. NVIDIA와 Perplexity는 9월 14일 Windows RTX PC용 Portable Computer를 공개했습니다. Qwen3.8 27B 등의 로컬 모델로 MCP·파일·앱 작업을 수행하는 agent 형태이며, 보도된 최소 조건은 RTX 24GB VRAM입니다. 즉 24GB GPU가 이제 단순 ‘27B 모델 실행’뿐 아니라 완성형 로컬 agent 플랫폼의 기준선으로도 자리 잡기 시작했습니다. speculative decoding, prompt lookup, KV-cache 양자화에서는 이번 주 범용 런타임의 판도를 바꿀 새 표준은 확인되지 않았습니다. 오히려 새 모델별 전용 draft model·전용 kernel이 늘면서 ‘기능 지원 여부’보다 특정 모델에서 실제로 안정적으로 작동하느냐가 더 중요해지고 있습니다. 가격·가성비 변화 이번 주 가장 큰 가성비 변화는 하드웨어 가격 인하가 아니라 소프트웨어 압축입니다. Bonsai 2처럼 27B급을 6GB 안팎에 넣는 방식이 품질까지 독립 검증된다면, 16~24GB 하드웨어의 수명과 활용 범위가 크게 늘어날 수 있습니다. 그러나 아직 전용 런타임이 필요하기 때문에 일반적인 Q4/Q5 GGUF를 완전히 대체했다고 보기는 이릅니다. 반대로 고용량 메모리 하드웨어 가격은 당분간 쉽게 내려갈 환경이 아닙니다. Reuters는 9월 16일 소형 PC·스마트폰 제조사들이 2027년까지 이어질 수 있는 DRAM 공급 부족에 대비하고 있다고 보도했고, DRAM 가격도 계속 상승 중이라고 전했습니다. 9월 20일에는 중국 CXMT의 새 DRAM 플랫폼 양산 소식이 나왔지만 단기간에 고용량 PC 메모리 가격을 뒤집을 정도인지는 아직 불확실합니다. RTX PRO 5500은 공식 가격이 나오지 않았고, 192GB Halo 제품도 OEM별 실판매 가격이 형성되는 단계입니다. 따라서 현재는 VRAM 1GB당 가격보다 ‘필요한 모델이 단일 노드에 들어가는가’가 구매 판단을 더 크게 좌우하는 시장입니다. 3~12개월 단기 전망 3개월 전망 — 신뢰도 중간. Bonsai식 ternary, MXFP 계열, 전용 speculative draft처럼 모델과 런타임이 묶인 최적화가 더 늘 가능성이 높습니다. 대신 GGUF 파일 하나만 받아 아무 엔진에서 실행하는 범용성은 일시적으로 나빠질 수 있습니다. Apple Metal, CUDA, ROCm, Vulkan마다 ‘가장 빠른 형식’이 달라지는 현상이 더 강해질 가능성이 있습니다. 6개월 전망 — 신뢰도 중간. 128~192GB Halo 시스템이 여러 OEM에서 늘면서 초대형 MoE를 단일 시스템이나 2노드로 돌리는 사례가 증가할 가능성이 큽니다. 2노드 이상에서는 10GbE가 사실상 입문선이 되고, 25GbE가 성능을 중시하는 구성에서 관심을 받을 가능성이 있습니다. 다만 네트워크가 빨라져도 tensor/expert parallel 통신과 노드 간 성능 불균형 때문에 노드 수에 비례한 속도 향상은 기대하기 어렵습니다. 12개월 전망 — 예측 불확실. DRAM/HBM 수요가 AI 서버에 계속 집중되고 있어 고용량 메모리 가격이 빠르게 정상화될 근거는 아직 약합니다. 중국 업체 증산과 신규 공급은 하방 요인이지만 실제 PC용 모듈 가격에 반영되는 시차가 있습니다. 환율 역시 한국 실판매가의 별도 변수입니다. 재미있는 대안/중고 발굴 이번 주 다시 볼 만한 것은 Tesla V100 32GB입니다. 최근 미국 중고 거래 데이터에서는 PCIe 32GB가 약 US$650 전후, 9월 16일 커뮤니티 판매도 SXM2 32GB가 $650에 올라왔습니다. 32GB HBM2와 900GB/s 대역폭, PCIe 모델 기준 250W라는 하드웨어 자체는 여전히 매력적입니다. 하지만 소프트웨어 수명은 분명히 꺾이고 있습니다. V100은 compute capability SM70/Volta이며 NVIDIA는 CUDA 13부터 Maxwell·Pascal·Volta의 오프라인 컴파일과 라이브러리 지원을 제거했습니다. CUDA 12.x에 고정하면 계속 사용할 수 있지만 최신 CUDA를 그대로 따라갈 수는 없습니다. vLLM도 현재 pip wheel에서는 실질적인 V100 지원이 빠졌지만, 커뮤니티에서는 CUDA 12.6으로 source build해 vLLM 0.21을 V100에서 실행하는 방법이 검증되고 있습니다. FlashAttention 역시 최신 upstream 경로보다는 별도 SM70 fork가 필요합니다. 즉 GGUF/llama.cpp처럼 비교적 단순한 추론에는 아직 쓸 만하지만, 최신 FP8·FlashAttention·Triton·vLLM 기능을 매번 즉시 쓰려는 용도에는 점점 불리해지는 카드입니다. 또한 V100 PCIe/SXM 제품은 서버용 수동 냉각 모델이 많아 케이스 풍량과 전원 설계가 필수입니다. 특히 SXM2는 일반 PCIe GPU처럼 꽂아 쓰는 제품이 아니므로 싸다는 이유만으로 구입하면 어댑터·냉각·전원 비용이 본체 가격을 따라갈 수 있습니다. 1~2년 관점에서는 ‘고정된 CUDA 12.x 환경을 받아들일 수 있는 저가 32GB 실험용’이 가장 정확한 위치입니다. 이번 주 결론 이번 주 변화는 로컬 AI가 두 방향으로 갈라지고 있음을 잘 보여줍니다. 한쪽에서는 27B를 5.9GB까지 줄이는 초저비트 모델이 나오고 있고, 다른 쪽에서는 84GB 단일 GPU, 192GB 통합메모리, 2~4노드 분산 추론으로 수백 B 모델을 직접 돌리는 방향이 커지고 있습니다. 따라서 앞으로는 “VRAM이 몇 GB인가” 하나만으로 하드웨어를 평가하기 어렵습니다. 모델 형식 → 런타임·커널 지원 → 실제 메모리 대역폭 → context/KV-cache → 네트워크 → 지속 냉각까지 함께 봐야 합니다. 특히 AMD Halo 멀티노드의 핵심은 여러 대를 묶어 속도를 몇 배 올리는 것이 아니라, 기존에는 로컬에서 아예 로드할 수 없던 모델을 실행 가능한 영역으로 끌어내리는 것입니다.
📰
이슈
-
·
-
·
약 1분 분량
·
0
|
댓글
댓글을 작성하려면 회원 로그인이 필요합니다.