Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep Learning
논문 링크 한 줄 요약 (TL;DR)Fire-Flyer 2는 1만 대의 PCIe A100 GPU를 HFReduce·HaiScale 스택으로 묶어 DGX-A100의 80 %대 성능을 장비·전력 40 % 절감으로 달성한 ‘가성비형 초대규모 LLM 훈련 클 …
기술과 일상에 대한 글 목록입니다.
논문 링크 한 줄 요약 (TL;DR)Fire-Flyer 2는 1만 대의 PCIe A100 GPU를 HFReduce·HaiScale 스택으로 묶어 DGX-A100의 80 %대 성능을 장비·전력 40 % 절감으로 달성한 ‘가성비형 초대규모 LLM 훈련 클 …
논문 링크 같은 논문을 2025-02-07 에도 한 번 더 정리해 두었다. DeepSeek-Coder: GPT-3.5 Turbo를 추월한 최초의 오픈소스 코드 LLMAI 실무자가 꿈꿔 온 “상용 수준을 넘어서는 공개 코드 모델”이 마침내 등장했다. …
논문 링크 DeepSeekMoE 정리 – Dense 성능을 40 % FLOPs로 끌어낸 ‘세분화-전문가’ 트릭한 줄 요약 (TL;DR)Fine-Grained Expert Segmentation (FGES) + Shared Experts (SEI) 로 …
논문 링크 📝 한 줄 요약 (TL;DR)DreamCraft3D는 2-스테이지 3D 생성 파이프라인과 *Bootstrapped Score Distillation(BSD)*라는 비밀 병기를 결합해, 단 한 장의 2D 이미지(또는 텍스트 프롬프트)만으로도 …
논문 링크 한 줄 요약 (TL;DR)STAND (STochastic Adaptive N-gram Drafting)은 추가 학습이나 별도 드래프트 모델 없이도 대규모 LLM의 테스트-타임 스케일링(Test-Time Scaling)을 가속한다. 표준 오토 …
논문 링크 ⚡️TL;DRKVzip는 LLM의 KV 캐시를 한 번 압축해도 이후 모든 질의 · 세션에서 재사용할 수 있도록 설계된 query-agnostic 캐시 컴프레서다. 그 결과 정확도 손실 ≤ 3 pp를 유지하면서 레이턴시 2 × ↓, 메모리 …