보통 로컬 LLM 돌리는데 글카 vram이 모자르면 꽝인데... Strata?라는게 있나봐요. LLM엔진? 메인 메모리와 GPU를 나눠 쓰는 Strata로 125B MoE를 돌릴수 있고 expert를 RAM에 두고 CPU가 전부 계산하면 18 tok/s 전후인 경우가 많은데, Strata는 attention만 VRAM에 고정하고 자주 쓰는 expert만 캐시한 뒤 vram에 올리나봅니다. NVIDIA만의 얘기가 아니고 AMD도 되고 디코드 50–70 tok/s, 워밍 후 80 tok/s대, 같은 가중치 기준 2배 이상이라는 측정도 있나 봅니다. 근데... 모델이 Qwen3.8-Flash-Next 계열만 되고 대충 메모리는 32기가는 넘어야 되나봐요. 대화형 코딩에는 쓸 만하고, 범용 엔진이나 자율 루프의 대체는 아니라는 모양이네요. AMD? 는 글카하나가 무난한 모양인데 7900xtx랑 주 메모리64기가 컴이라 난가!? 하면서 관심이 가는군요. 🤔 뭐 사실 걍 구독이 갑이네 하다가도 간간히 뭐 나왔대! 하면 그으래?? 하면서 관심가네요...
📰
이슈
-
·
-
·
0
|
댓글 0
댓글을 작성하려면 회원 로그인이 필요합니다.