ollama로 128gb 메모리에 162gb 모델을 올려봤습니다.
https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF/tree/main/UD-Q8_K_XL
여러 시행착오 끝에 모델 올리는 것까지 성공을 했어요.
기본 개념은 간단합니다.
[ollama는 메모리 부족시 swap을 통해 부족한 메모리를 확보하니, 162gb 모델도 올릴 수 있다.]
swap을 100gb로 바꾸고, gguf 모델을 다운받아 하나로 합치고(분리된 상태로는 ollama가 받아들이지 않네요),
합친 파일에 문제가 있어 copy로 문제 해결하고...
이 외에 다른 설정은 건드리지 않고, unsloth 모델을 올렸는데 쓸만하지는 않네요.
일단 모델이 올라가는 시간이 엄청납니다. 대략 20분 정도 걸리는 것 같아요.
모델이 올라간 후에도 문제네요.
"안녕"이라고 입력하고 5분 넘게 로딩중이에요.
"올려는 드릴게." 수준이라 실사용은 못할 것 같습니다.

이 글을 쓰고 있는 지금까지 "안녕"에 대한 답변은 받지 못하고 있습니다.
