HW: 맥미니 M4 32GB (레어템이죠...) 올라마 챗에선 20B 이하들도 잘 굴러가는데 오픈클로에 물리는 순간 대답하는 것조차도 버거운 경우가 대부분입니다. 대화도 어려운데 뭔가 일을 시킨다? 거의 포기하고 살았죠. 문제는 오픈 AI 정책상 막히는 작업들이 있다는 겁니다. 그래서 올라마에서 젬마4-31B-클라우드 모델을 써봤고 오픈 AI가 막은 거 기가막히게 잘 하더군요. (GPT 5.x시절에 만든 자동화 작업 수정을 6부턴 정책상 안 된다고 막아버렸고 이걸 로컬 LLM으로 우회...) 문젠 올라마 클라우드도 유료모델이라 무료 한도 다 차면 한도 초기화될때까지 기다리던가 돈 내야 합니다 ㄷㄷㄷ 그래서 젬마 31B를 LLM으로 올려봤지만..... 클라우드에서 1분도 안 걸리는 거 30분 넘게 진행중이어서 포기. qwen3.6:35b도 포기.. 그런데 젬마4-26b를 쓰니 느리긴 느려도 (5~6분 걸림) 되긴 되네요 ㄷㄷㄷ (예전엔 올라마 굴리면 CPU만 디립따 썼던걸로 기억하는데 간만에 쓰니 MLX를 지원해서인지 지금은 GPU만 죽어라 갈구네요. 덕택에 LLM 돌리면서 컴터 쓰긴 한결 편해지네요) 로그 찍으보면 로컬 LLM에서 가장 큰 문제가 HW성능이나 RAM이 아니라 컨텍스트인거 같더군요. 앞서 31B 모델들 30분 넘게 작업중 뜨는것ㅎ도 컨텍스트 오바되던게 문제고.. 26B는 어째 어째 32K 안에 압축 몇 번 해서 들어가는 거 같더군요. 시간은 걸리지만 오픈 AI 정책 우회용으로 추가비용 없이 가능하다는 점에 감사하고 있습니다 ㄷㄷㄷ 결론: 풀로 돌리는 건 무리지만 이런 우회용으로써 드디어 로컬 LLM을 써먹기시작합니다 ㄷㄷㄷ 덧: 근데 오픈클로들도 메모리 임베딩으로 4B짜리 로컬 LLM을 알아서 쓰기도 하고 그러더군요.
📰
이슈
-
·
-
·
약 1분 분량
·
0
|
댓글
댓글을 작성하려면 회원 로그인이 필요합니다.