MARKETS
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
KOSPI
KOSDAQ
S&P 500
NASDAQ
USD/KRW
BTC
NIKKEI
WTI
Wittgenhaus

2026년 7월 23일 목요일

AI 시대, 당신을 더욱 스마트하게

AI검증

허깅페이스, 디퓨저스 라이브러리에 넌차쿠 라이트 도입

허깅페이스가 대규모 확산 모델의 접근성을 높이기 위해 넌차쿠 라이트를 디퓨저스 라이브러리에 통합했습니다. 이번 업데이트로 일반 소비자용 그래픽 처리 장치에서도 고성능 모델을 효율적으로 구동할 수 있게 되었습니다.

2026년 7월 23일

주장허깅페이스는 디퓨저스 라이브러리에 넌차쿠 라이트를 통합하여 대규모 확산 모델의 접근성을 개선했습니다. 기존의 무거운 BF16 모델은 일반 소비자용 그래픽 처리 장치에서 구동하기 어려웠으나, 이번 업데이트로 메모리 요구 사항을 크게 낮췄습니다.

팩트넌차쿠 라이트는 SVDQuant 양자화 방식을 사용하여 가중치와 활성화 함수를 4비트로 처리합니다. 이 방식은 모델의 메모리 사용량을 줄이는 동시에 디노이징 루프의 속도를 가속화합니다.

팩트사용자는 별도의 추론 라이브러리 설치나 로컬 CUDA 컴파일 없이 함수 호출만으로 양자화된 체크포인트를 불러올 수 있습니다. 필요한 커널은 허깅페이스 허브를 통해 자동으로 내려받습니다.

교차검증넌차쿠 라이트는 모델별로 최적화된 넌차쿠 엔진의 융합 커널을 사용하지 않기에 최고 속도 측면에서는 원본 엔진보다 다소 느릴 수 있습니다. 하지만 약 30%의 속도 향상과 동일한 수준의 비디오 램 절감 효과를 제공하여 범용성을 확보했습니다.

팩트넌차쿠 라이트의 NVFP4 체크포인트는 엔비디아 블랙웰 아키텍처에서만 지원됩니다. 이전 세대인 튜링, 암페어, 에이다 아키텍처 사용자는 INT4 변형 버전을 사용해야 합니다.

팩트벤치마크 결과, RTX 5090 환경에서 1024x1024 해상도 이미지를 생성할 때 약 1.7초가 소요되었습니다. 이때 피크 메모리 사용량은 약 12GB로, 기존 BF16 파이프라인의 24GB 대비 절반 수준으로 감소했습니다.

주장넌차쿠 라이트는 기존 디퓨저스 모델 구조를 유지하므로 스케줄러, 로라 로딩, 토치 컴파일 등 기존 생태계 도구와 호환됩니다. 이는 개발자가 추가적인 코드 수정 없이도 고성능 양자화 모델을 즉시 도입할 수 있음을 의미합니다.

팩트성능을 극대화하기 위해 토치 컴파일을 활용하면 추론 속도를 최대 1.8배까지 향상할 수 있습니다. 또한 텍스트 인코더를 비츠앤바이트 NF4로 추가 양자화할 경우 피크 비디오 램을 약 22% 더 줄일 수 있습니다.

교차검증현재 볼타 및 호퍼 아키텍처 그래픽 처리 장치는 4비트 커널을 지원하지 않습니다. 시스템은 로드 시점에 그래픽 처리 장치의 쿠다 성능을 확인하며, 지원되지 않는 환경에서는 오류를 발생시켜 잘못된 결과물 생성을 방지합니다.

주장이번 통합은 고성능 인공지능 모델을 개인용 컴퓨터 환경에서 더 쉽게 활용하려는 허깅페이스의 전략을 반영합니다. 개발자는 하드웨어 제약을 극복하고 창의적인 애플리케이션 개발에 집중할 수 있습니다.

팩트허깅페이스는 지속적인 업데이트를 통해 디퓨저스 라이브러리의 최적화 수준을 높이고 있습니다. 이번 넌차쿠 라이트 도입은 대규모 모델의 경량화 표준을 제시하는 사례가 됩니다.

출처허깅페이스 공식 블로그 및 디퓨저스 문서를 교차 검증했습니다.

본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

스팟

WIRE

버블 지표

상세보기 →

릴리즈 & 논문

전체보기 →

PAPERS