특가
← 이전 글
다음 글 →

불러오는 중

↔

화면을 좌우로 스와이프하여 다음/이전 글로 넘겨보세요

📰
이슈
- ·
0
|

잡담) Strata...글카별로고 메모리좀 되는 환경에 딱인 LLM엔진?

보통 로컬 LLM 돌리는데 글카 vram이 모자르면 꽝인데... Strata?라는게 있나봐요. LLM엔진? 메인 메모리와 GPU를 나눠 쓰는 Strata로 125B MoE를 돌릴수 있고 expert를 RAM에 두고 CPU가 전부 계산하면 18 tok/s 전후인 경우가 많은데, Strata는 attention만 VRAM에 고정하고 자주 쓰는 expert만 캐시한 뒤 vram에 올리나봅니다. NVIDIA만의 얘기가 아니고 AMD도 되고 디코드 50–70 tok/s, 워밍 후 80 tok/s대, 같은 가중치 기준 2배 이상이라는 측정도 있나 봅니다. 근데... 모델이 Qwen3.8-Flash-Next 계열만 되고 대충 메모리는 32기가는 넘어야 되나봐요. 대화형 코딩에는 쓸 만하고, 범용 엔진이나 자율 루프의 대체는 아니라는 모양이네요. AMD? 는 글카하나가 무난한 모양인데 7900xtx랑 주 메모리64기가 컴이라 난가!? 하면서 관심이 가는군요. 🤔 뭐 사실 걍 구독이 갑이네 하다가도 간간히 뭐 나왔대! 하면 그으래?? 하면서 관심가네요...

댓글 0

댓글을 작성하려면 회원 로그인이 필요합니다.

댓글을 불러오는 중...

© DAMPICK