딥시크 로컬 실행이 2배 빨라진다… Unsloth의 무료 업데이트

Unsloth가 DeepSeek-V4-Flash GGUF에 DSpark를 적용해 로컬 추론을 1.4~2배 가속했다. 정확도 손실 없이 오픈 모델을 더 빠르게 돌리는 법을 정리했다.

H
Huuush발행 2026.08.07 · 3분 read에디터: Jay Kim

3줄 요약

  • Unsloth가 DeepSeek-V4-Flash GGUF에 DSpark를 적용해 정확도 손실 없이 로컬 추론을 1.4~2배 가속했다.
  • 동적 양자화와 가속 기술로 양자화 상태를 유지한 채 추론 파이프라인을 최적화하며, MTP를 자동 활성화해 디코딩 속도를 추가로 끌어올린다.
  • 모든 버전이 최소 92GB부터의 RAM/VRAM을 요구해 개인 PC가 아닌 워크스테이션·서버급 환경을 전제로 한다.

로컬 AI 추론 최적화 도구 UnslothDeepSeek-V4-Flash-0731 GGUF에 DSpark를 적용했다. 결과는 로컬 추론 1.4~2배 가속 — 정확도 손실 없이 더 빠르게 오픈 모델을 돌릴 수 있게 됐다.

Unsloth DSpark로 DeepSeek V4 Flash 로컬 추론이 가속되는 벤치마크
Unsloth DSpark + DeepSeek-V4-Flash — 로컬 추론 속도 비교 (출처: X 포스트)

같은 딥시크가 2배 빨라졌다, DSpark의 변화

Unsloth의 동적 양자화(Dynamic GGUF) + 가속 기술이다. 모델의 양자화 상태를 유지하면서 추론 파이프라인을 최적화해, 품질은 유지한 채 속도만 올린다. MTP(멀티 토큰 예측)를 자동 활성화해 디코딩 속도를 추가로 끌어올린다.

V4 Flash가 로컬에서 주목받는 이유, 속도만은 아니다

  • 규모: 총 284B 파라미터, 토큰당 활성 13B (MoE)
  • 컨텍스트: 최대 100만 토큰
  • 성능: Terminal Bench 2.1에서 82.7% — 같은 크기에서 V4-Pro(프리뷰)를 능가

내 GPU에는 어느 버전이 맞나, 양자화 선택의 기준

버전크기품질
UD-Q8_K_XL162GB완전 무손실 — 공식 가중치와 비트 단위 동일
UD-Q4_K_XL155GB근무손실 — 비전문 텐서만 Q8
UD-IQ3_XXS103GB추천 — 품질/용량 밸런스
1-bit / 2-bit92GB / 102GB최소 용량

전부 상당한 RAM/VRAM이 필요하다 — 최소 92GB부터, 추천 103GB 버전은 110GB 이상. 대부분의 개인 PC가 아니라 워크스테이션·서버급 환경을 전제로 한다.

설치 전 한 번 더, 성능표가 말하지 않는 조건

1. 최신 llama.cpp 필수 — 최신 PR이 없으면 Q8 GGUF가 잘못된 결과를 낸다.
2. RAM이 핵심 병목 — 큰 컨텍스트를 쓰면 110~135GB까지 필요할 수 있다.
3. 2x RTX 3090 커뮤니티 양자화에서 초기 생성 속도가 7~8 t/s로 느리다는 보고도 있다.

로컬 추론 비용을 낮추는 한 가지, 속도보다 중요한 것

오픈 가중치 진영이 '모델 성능'에서 '운영 효율'로 경쟁을 넓히고 있다. 같은 모델을 더 빠르게, 더 적은 자원으로 돌리는 기술은 로컬 AI 운영 비용을 낮추는 핵심이다. 하드웨어가 갖춰진 환경이라면 바로 써볼 만한 업데이트다.

관련: Unsloth 릴리스 · Hugging Face · X 포스트

자주 묻는 질문

이 글에서 다룬 벤더