The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction
논문 링크 SSD에 산 MoE를 깨우다: 24 GB 데스크톱에서 35B MoE를 20 tok/s로 서빙하는 Edge0한 줄 요약 (TL;DR)35B급 MoE는 4-bit로도 19.5 GB 를 차지해 24 GB 머신에 상주하지 못한다 (근거: §1). …
논문 링크 SSD에 산 MoE를 깨우다: 24 GB 데스크톱에서 35B MoE를 20 tok/s로 서빙하는 Edge0한 줄 요약 (TL;DR)35B급 MoE는 4-bit로도 19.5 GB 를 차지해 24 GB 머신에 상주하지 못한다 (근거: §1). …
논문 링크 Miles v0.1: 프론티어 RL 사후학습을 위한 “검증·청결·확장 가능"한 풀스택 시스템TL;DR : Miles는 rolluout 생성과 트레이닝이 서로 다른 엔진·커널·정밀도로 돌아가며 발생하는 …
논문 링크 캐시를 배우는 라우터 : 메모리-제약 MoE 추론을 위한 Cache-Aware Joint Router Adaptation한 줄 요약 (TL;DR)MoE의 진짜 병목은 연산량이 아니라 전문가 가중치 이동량이다 라는 문제의식에서 출발해, 네이티 …
논문 링크 SMELT: 계산량을 맞춘 MoE 루프 트랜스포머의 스케일링 법칙한 줄 요약 (TL;DR)루프 트랜스포머는 레이어 블록을 반복 실행해 깊이를 늘리지만, 기존 연구는 대부분 파라미터 수만 고정한 채 FLOPs를 늘려 “공짜 점수 …
![[논문리뷰]: Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models](https://paper-assets.alphaxiv.org/figures/2601.07372v1/img-0.jpeg)
논문 링크 Engram: 조건부 연산(MoE) 이후의 두 번째 희소성 축, 조건부 메모리(Conditional Memory)한 줄 요약 (TL;DR)Engram은 Transformer에 “지식 조회(lookup) primitive”를 추가해, 표준 모 …
![[논문리뷰]: NVIDIA Nemotron 3: Efficient and Open Intelligence](https://developer-blogs.nvidia.com/wp-content/uploads/2025/12/image3-8-png.webp)
논문 링크 NVIDIA Nemotron 3: 하이브리드 Mamba–Transformer MoE로 “정확도/처리량” 프런티어를 당기다Nemotron 3 는 MoE 하이브리드 Mamba–Transformer, LatentMoE , MTP , NVFP4 학 …
논문 링크 Qwen 3: 생각량을 조절하는 거대 MoE 언어모델의 진화한 줄 요약 (TL;DR)Qwen 3는 “얼마나 깊게 생각할지”를 토큰 수치로 직접 제어할 수 있는 Thinking Budget과 128-전문가 MoE 설계를 결합해, 활성 파라미터 …
![[논문리뷰] Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding](https://www.storagereview.com/wp-content/uploads/2025/07/image2-2-png-e1752234784623.webp)
논문 링크 Helix Parallelism: 초장기 LLM 디코딩의 지연-처리량 벽을 깨다한 줄 요약 (TL;DR)Helix Parallelism은 Attention과 FFN을 서로 다른 병렬화 전략으로 스케줄링해 KV 캐시 중복과 FFN 가중치 로드 …
논문 링크 한 줄 요약 (TL;DR)Loss-Free Balancing(LFB)은 auxiliary loss를 완전히 제거한 채, 전문가별 bias 한 줄 업데이트만으로 Mixture-of-Experts(MoE) 모델의 ‘로드 밸런스 ↔ 성능’ 딜레마 …