CLIEN

본문 바로가기 메뉴 바로가기 보기설정 테마설정
톺아보기 공감글
커뮤니티 커뮤니티전체 C 모두의광장 F 모두의공원 I 사진게시판 Q 아무거나질문 D 정보와자료 N 새로운소식 T 유용한사이트 P 자료실 E 강좌/사용기 L 팁과강좌 U 사용기 · 체험단사용기 W 사고팔고 J 알뜰구매 S 회원중고장터 B 직접홍보 · 보험상담실 H 클리앙홈
소모임 소모임전체 ·굴러간당 ·아이포니앙 ·주식한당 ·MaClien ·일본산당 ·방탄소년당 ·자전거당 ·야구당 ·개발한당 ·노젓는당 ·이륜차당 ·안드로메당 ·소리당 ·나스당 ·육아당 ·소시당 ·캠핑간당 ·소셜게임한당 ·찰칵찍당 ·걸그룹당 ·달린당 ·젬워한당 ·시계찬당 ·창업한당 ·스팀한당 ·이브한당 ·심는당 ·리눅서당 ·패스오브엑자일당 ·콘솔한당 ·IoT당 ·퐁당퐁당 ·골프당 ·가상화폐당 ·물고기당 ·사과시계당 ·바다건너당 ·3D메이킹 ·X세대당 ·ADHD당 ·AI당 ·AI그림당 ·날아간당 ·배드민턴당 ·농구당 ·블랙베리당 ·곰돌이당 ·비어있당 ·FM당구당 ·블록체인당 ·보드게임당 ·활자중독당 ·볼링친당 ·냐옹이당 ·문명하셨당 ·클래시앙 ·클다방 ·요리한당 ·쿠키런당 ·대구당 ·DANGER당 ·뚝딱뚝당 ·디아블로당 ·개판이당 ·동숲한당 ·날아올랑 ·전기자전거당 ·e북본당 ·갖고다닌당 ·패셔니앙 ·도시어부당 ·FM한당 ·맛있겠당 ·포뮬러당 ·안경쓴당 ·차턴당 ·총쏜당 ·땀흘린당 ·하스스톤한당 ·히어로즈한당 ·인스타한당 ·KARA당 ·키보드당 ·꼬들한당 ·덕질한당 ·어학당 ·가죽당 ·레고당 ·LOLien ·Mabinogien ·임시소모임 ·미드당 ·밀리터리당 ·땅판당 ·헌팅한당 ·오른당 ·영화본당 ·MTG한당 ·노키앙 ·적는당 ·방송한당 ·PC튜닝한당 ·그림그린당 ·소풍간당 ·라즈베리파이당 ·품앱이당 ·리듬탄당 ·Sea마당 ·SimSim하당 ·심야식당 ·윈태블릿당 ·미끄러진당 ·축구당 ·나혼자산당 ·스타한당 ·파도탄당 ·테니스친당 ·테스트당 ·빨콩이당 ·공대시계당 ·여행을떠난당 ·터치패드당 ·트윗당 ·VR당 ·WebOs당 ·위스키당 ·와인마신당 ·WOW당 ·윈폰이당
임시소모임
고객지원
  • 게시물 삭제 요청
  • 불법촬영물등 신고
  • 쪽지 신고
  • 닉네임 신고
  • 제보 및 기타 제안
© CLIEN.NET
공지[점검] 잠시후 서비스 점검을 위해 약 30분간 접속이 차단됩니다. (금일 18:15 ~ 18:45)

사용기

전자기기
AI Max+ 395 128GB system (Strix Halo) 16

2
그레이시치
2,650
2026-09-11 14:31:19 수정일 : 2026-09-11 16:46:03 59.♡.99.125

Local LLM 을 구동해보겠다는 생각에 DGX spark 와 Strix Halo 를 비교하다가, 그래도 조금은 다목적으로 쓸 수 있고, 가격도 훨씬 낮은 Strix Halo 에 마음이 쏠려 직구로 구매했습니다.

 LLM 을 구동해서 실무적으로 사용하실 목적이라면 비추입니다. 30B 정도 모델은 5 token/s (dense 기준) 이하의 성능이 나옵니다. rocm 세팅도 사실 절대 쉽지 않습니다. 현재 제가 보는 5 t/s 의 성능이 이론적 한계치인지, 아니면 제가 세팅을 잘못한것인지 아직도 확신이 없습니다. 처리 속도가 너무 늦으니 128GB 공간의 장점이 거의 쓸모가 없습니다. 이 공간이 모자랄 만큼의 토큰 생성이 현실적인 사용 시간 내에 안됩니다. Strix Halo 자체의 문제는 아니지만,  시험해본 바로는 30B 수준 정도가 범용적으로 쓸 수 있는 모델의 하한선 같은 느낌이 듭니다. 이것보다 작은 모델들은 희한한 바보 짓을 꼭 합니다. 정말 간단한 내용이 아니라면, 조금이라도 머리를 쓰는 업무라면 30B 이상급 모델이 필요해 보입니다.

8060S core 의 순수 그래픽 성능은 4060~4070 사이의 어디 쯤 정도입니다.3Dmark 돌려보니 딱 그렇게 나옵니다. 게임이 아닌 VRAM 을 많이 쓰는 어플리케이션 실행에 강점이 있다라고 하는데, 그런 어플을 쓸 일이 없네요.

LLM 이 아닌 ,다른 용도의 작은 모델들을 대량으로 여러 개 올려서 동시에 사용이 가능합니다. 예를 들자면, 음성 인식 + 페이스 인식 + 영상 생성 + 음성 합성 같은 모델을 모두 동시에 올려놓고 사용이 됩니다. 물론 동시 실행은 아닙니다. 모델들이 크기가 커서 하나 올리고 다른 것 새로 올리고 하는 식으로 사용하면 그것도 은근히 시간을 잡아 먹습니다.그래서 이렇게 그냥 각각 전부 올려놓고 그 때그 때 필요한 모델 불러서 사용하는 방식으로 작업이 가능합니다. LLM 이 아닌 모델들은 그 크기가 5GB 넘는 것이 드뭅니다. 그래서 처리 속도도 상당히 좋습니다.

x86 기반 시스템이어서 불편한 점이 하나 있습니다. 128GB 중 , 얼마를 CPU main memory, 얼마를 VRAM 에 할당할지 BIOS setup 에서 지정해야 합니다. 즉, CPU memory 100GB 짜리 작업을 하다 , VRAM 90GB  짜리 작업을 하려면 재부팅해서 bios setup 에서 설정을 수정해야 합니다. 뭔가 VRAM 을  일반 메모리처럼 인식시키는 D/D 같은 것이 있었으면 좋겠습니다.

정리하자면 , 128GB 메모리대비 처리속도가 너무 아쉽습니다. 듣기로는 이 처리 속도의 제약은 8060S GPU의 계산 성능 제약과, LPDDR5  기반의 메모리 대역 모두에 책임이 있다고 합니다.

그리고 반전이 있습니다. 이 시스템을 AI 연구를 위한 대용량 VRAM 을 가진 보급용 시스템이 아니라, 그냥 windows server 라고 보는 겁니다.  CPU 가 16 core 32 thread 의 최고사양 AMD desktop cpu 와 맞먹습니다. 메모리는 대역폭이 서버급보다 빠르며 128GB 입니다. 이런 서버 시스템이면서 gpu 성능도 4060보다 높습니다. 10Gbps network card 에 UsB 4.0 interface 도 다수 입니다.  미 모든 사양에  전력을 100W 미만으로 먹습니다.일반 서재나 침실에서 구동해도 될 정도로 소음도 작습니다. 뭐랄까 자기 주전공보다 보조 전공을 훨씬 잘하는 것 같은 시스템입니다.


PS.제가 올렸던 모델은 Qwen 3.8 27B Q8 입니다.  그런데, 커뮤니티 평가를 보니 Qwen 3.8 flash-next 125B Q4 를 쓰면 추론 성능과 속도 모두 다 우위에 있을 것이라는 추천이 있네요. 문제는 메모리 크기군요. 이 Qwen 3.8 은 구조가 특이해서 Q4 라고 해도 125B/2  보다 용량이 더 큽니다. 128GB 시스템에서는 간당간당하다는 느낌이네요.

그레이시치 님의 게시글 댓글
  • 주소복사
  • Facebook
  • X(Twitter)
댓글 • [16] 을 클릭하면 간단한 회원메모를 할 수 있습니다.
LinkeneitoR
IP 210.♡.105.7
09-11 2026-09-11 15:39:51
·
게임을 구동할때는 시스템에 120GB를 할당하고 VRAM을 8GB를 할당을 해도
8GB이상의 VRAM을 먹는 게임을 할때 성능저하가 없는데
(물론 게임 내부에서 옵션 추천할때는 8GB밖에 안되는걸로 보고 맞춰지긴 합니다)
AI연산 돌릴때는 VRAM을 강제할당 해야 하나보네요.
그레이시치
IP 59.♡.99.125
09-11 2026-09-11 15:47:38
·
@LinkeneitoR님
게임할 때 쓰는 8GB 정도에 추가로 8GB 정도 더 가져오는 수준은 문제없습니다. 그런데 LLM 을 로딩하려면 VRAM 에 원래 할당된 메모리가 LLM 크기보다 더 커야 합니다.일단 로딩이 되면 동적할당으로 추가 메모리를 가져올 수는 있는데, 처음에 너무 VRAM 이 작으면 로딩 자체가 안됩니다. 또, 동적 할당은 가용한 모든 메모리가 아니라 시스템 메모리의 일정 비율 이하로만 가능합니다. 예를 들자면 96GB VRAM + 32GB system ram 상태에서 VRAM 쪽으로 추가적으로 10GB 정도 가져오는 것은 될겁니다. 그런데 32GB VRAM + 96GB system 에서 동적으로 64GB 정도를 추가로 가져오는 것은 안되는 것으로 알고 있습니다.
chunho70
IP 1.♡.252.154
09-11 2026-09-11 15:42:37 / 수정일: 2026-09-11 15:49:24
·
더 후진 780m system 도 30B 정도 모델은 잘 돌던데요?? token 측정은 어떻게 하신 건가요?

qwen3.6-35B model (23G) 인데 ollama 에서 prompt eval 은 60 정도 eval 은 17 token 정도 되네요.
그레이시치
IP 59.♡.99.125
09-11 2026-09-11 15:50:58 / 수정일: 2026-09-11 15:57:02
·
@chunho70님
양자화를 어떻게 하셨나요? 저는 Q8 상태로 돌렸습니다. 그 이하는 이상한 현상이 가끔씩 있어서 웬지 기피되더라고요. 그리고 Qwen 3.6 35이면 MoE 아닌가요? 제가 시험한 것은 Dense 입니다. 그리고 당연히 저 token 성능은 single session 기준입니다. 복잡하게 bench 같은 것 안쓰고 그냥 첫번째 token 나온 시점부터, 1분간 나온 token 수를 직접 세었습니다.
chunho70
IP 1.♡.252.154
09-11 2026-09-11 15:55:45
·
35B 에 23G 크기면 Q8 은 아닐겁니다. Vram 에 올라가는 size 로 받은 것이라서요.
토마토마적토마
IP 165.♡.168.117
09-11 2026-09-11 15:45:17
·
귀한 사용기네요. LLM 사용을 목적으로 만든걸로 이해했는데 그 정도로 느리다면 적합한 용도가 무엇일까요? 아니면 작은 모델 운용 목적이려나요? Fine Tunning? BIOS에서 메모리 미리 지정해야 하는 건 불편하네요. 사용하기 전엔 알 수가 없는 귀한 정보 감사합니다.
푸른파도17
IP 119.♡.175.218
09-11 2026-09-11 15:52:00
·
395+로도.. vram 이 아니라 대역폭 한계 때문에 원활하게 안되나 보네요.
해보고 싶던거였는데. 정보 감사합니다.
도장
IP 222.♡.114.172
09-12 2026-09-12 00:24:53 / 수정일: 2026-09-12 00:30:29
·
애초에 Dense 모델을 쓰면 안되는 플랫폼입니다. 용량은 크고 연산능력은 좀 떨어지고 대역폭은 한참 떨어지다 보니, active parameter가 한자리수인 MoE 모델로 가야합니다. PS에 언급하신 Qwen 3.8 flash-next가 125B-A6B 크기의 MoE 모델이네요. 요정도 크기가 제일 좋죠. 저는 데비안 서버에 llama.cpp 로 gemma-4-26B-A4B 를 UD-Q4_K_XL(14.2 GB) 양자화 버전 주력으로 돌리고 있는데, 초반 기준 60t/s 가까이 나옵니다.
메모리 조정은 리눅스에선 VRAM 할당 최소화 + 공유메모리 세팅으로 해도 속도저하 없이 LLM 구동이 가능해서 이렇게 쓰고 있는데, 윈도우도 가능한 방법이 있지 않을까 싶습니다.
조용히
IP 1.♡.18.99
09-12 2026-09-12 02:34:53
·
모델선택이 잘못되신듯 합니다. qwen 3.6 추천드립니다. 27b다 올려서 읽는 모델은 ...
Scalpel
IP 59.♡.108.78
09-12 2026-09-12 11:53:44
·
리눅스 쓰시면 GTT로 VRAM 할당을 극대화할 수 있습니다. 추가적으로 Qwen3.8-Flash-Next 구동 시에는 n-gram 임베딩 부분을 ssd에서 오프로딩시키면 구동 가능할겁니다.
Aki_Rose
IP 115.♡.6.90
09-12 2026-09-12 12:18:25 / 수정일: 2026-09-12 12:18:37
·
EVO-X2 사용해봤을 때는 ROCm 사용하는 것 보다, Vulkan 사용하는 편이 성능이 더 좋았습니다.
anotherK
IP 116.♡.209.69
09-12 2026-09-12 19:53:30 / 수정일: 2026-09-13 14:34:44
·
llama.cpp에서 rocm 최적화가 잘 안돼 있습니다. rocm10 쓰면 pp속도는 vulkan보다 확실히 빨라지는데 tg 속도는 여전히 5%정도 뒤지는것을 봤습니다. ubuntu 26.04-r9700 입니다. 아무리 strix halo 메모리 대역폭이 낮다해도 tg 5는 너무 낮은데요.
hidnbox
IP 187.♡.132.101
03:09 2026-09-13 03:09:56
·
사용기 잘 봤습니다. 메모리 용량 봐서는 사고 싶었는데 이 시스템도 가격이 만만치는 않더라구요.
로빈09
IP 14.♡.153.7
08:44 2026-09-13 08:44:19
·
사양이 같은 장비를 사용중 입니다.

Ubuntu 26.04 서버
llama.cpp vulkan
Qwen 3.8 Flash next Q4 로 MTP 없이 25~28 토큰 나옵니다.
Qwen 3.8 27B UD-Q6 로 25
바이오스 에서는 OS 에 8GB만 할당 나머지는 전부 VRAM 으로 운영 중입니다.

Strix Halo 는 분명 사용처가 있는 AI 머신 입니다.
그레이시치
IP 121.♡.138.85
09:18 2026-09-13 09:18:51
·
BIOS 에서 VRAM 120GB 할당이 되는지요? 제가 가진 시스템은 VRAM 할당이 96GB 가 한계입니다. 그 이상은 할당 자체가 안되네요.
anotherK
IP 116.♡.209.69
14:32 2026-09-13 14:32:50 / 수정일: 2026-09-13 14:33:22
·
@그레이시치님 리눅스와 윈도우가 vram 할당 가능량이 다릅니다. amd gpu 갖고 ai하려면 윈도우는 비추란 말이 많습니다.
새로운 댓글이 없습니다.
이미지 최대 업로드 용량 15 MB
업로드 가능 확장자 jpg,gif,png,jpeg,webp
지나치게 큰 이미지의 크기는 조정될 수 있습니다.
목록으로
글쓰기
목록으로 댓글보기 이전글 다음글
아이디  ·  비밀번호 찾기 회원가입
이용규칙 운영알림판 운영소통 재검토요청 도움말 버그신고
개인정보처리방침 이용약관 책임의 한계와 법적고지 청소년 보호정책
©   •  CLIEN.NET
보안 강화를 위한 이메일 인증
안전한 서비스 이용을 위해 이메일 인증을 완료해 주세요. 현재 회원님은 이메일 인증이 완료되지 않은 상태입니다.
최근 급증하는 해킹 및 도용 시도로부터 계정을 보호하기 위해 인증 절차가 강화되었습니다.

  • 이메일 미인증 시 글쓰기, 댓글 작성 등 게시판 활동이 제한됩니다.
  • 이후 새로운 기기에서 로그인할 때마다 반드시 이메일 인증을 거쳐야 합니다.
  • 2단계 인증 사용 회원도 최초 1회는 반드시 인증하여야 합니다.
  • 개인정보에서도 이메일 인증을 할 수 있습니다.
지금 이메일 인증하기
등록된 이메일 주소를 확인하고 인증번호를 입력하여
인증을 완료해 주세요.