로컬 AI 추론 최적화 도구 Unsloth가 DeepSeek-V4-Flash-0731 GGUF에 DSpark를 적용했다. 결과는 로컬 추론 1.4~2배 가속 — 정확도 손실 없이 더 빠르게 오픈 모델을 돌릴 수 있게 됐다.
같은 딥시크가 2배 빨라졌다, DSpark의 변화
Unsloth의 동적 양자화(Dynamic GGUF) + 가속 기술이다. 모델의 양자화 상태를 유지하면서 추론 파이프라인을 최적화해, 품질은 유지한 채 속도만 올린다. MTP(멀티 토큰 예측)를 자동 활성화해 디코딩 속도를 추가로 끌어올린다.
V4 Flash가 로컬에서 주목받는 이유, 속도만은 아니다
- 규모: 총 284B 파라미터, 토큰당 활성 13B (MoE)
- 컨텍스트: 최대 100만 토큰
- 성능: Terminal Bench 2.1에서 82.7% — 같은 크기에서 V4-Pro(프리뷰)를 능가
내 GPU에는 어느 버전이 맞나, 양자화 선택의 기준
| 버전 | 크기 | 품질 |
|---|---|---|
| UD-Q8_K_XL | 162GB | 완전 무손실 — 공식 가중치와 비트 단위 동일 |
| UD-Q4_K_XL | 155GB | 근무손실 — 비전문 텐서만 Q8 |
| UD-IQ3_XXS | 103GB | 추천 — 품질/용량 밸런스 |
| 1-bit / 2-bit | 92GB / 102GB | 최소 용량 |
전부 상당한 RAM/VRAM이 필요하다 — 최소 92GB부터, 추천 103GB 버전은 110GB 이상. 대부분의 개인 PC가 아니라 워크스테이션·서버급 환경을 전제로 한다.
설치 전 한 번 더, 성능표가 말하지 않는 조건
1. 최신 llama.cpp 필수 — 최신 PR이 없으면 Q8 GGUF가 잘못된 결과를 낸다.
2. RAM이 핵심 병목 — 큰 컨텍스트를 쓰면 110~135GB까지 필요할 수 있다.
3. 2x RTX 3090 커뮤니티 양자화에서 초기 생성 속도가 7~8 t/s로 느리다는 보고도 있다.
로컬 추론 비용을 낮추는 한 가지, 속도보다 중요한 것
오픈 가중치 진영이 '모델 성능'에서 '운영 효율'로 경쟁을 넓히고 있다. 같은 모델을 더 빠르게, 더 적은 자원으로 돌리는 기술은 로컬 AI 운영 비용을 낮추는 핵심이다. 하드웨어가 갖춰진 환경이라면 바로 써볼 만한 업데이트다.
관련: Unsloth 릴리스 · Hugging Face · X 포스트



