![[논문리뷰] Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding](https://www.storagereview.com/wp-content/uploads/2025/07/image2-2-png-e1752234784623.webp)
[논문리뷰] Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding
논문 링크 Helix Parallelism: 초장기 LLM 디코딩의 지연-처리량 벽을 깨다한 줄 요약 (TL;DR)Helix Parallelism은 Attention과 FFN을 서로 다른 병렬화 전략으로 스케줄링해 KV 캐시 중복과 FFN 가중치 로드 …
기술과 일상에 대한 글 목록입니다.
![[논문리뷰] Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding](https://www.storagereview.com/wp-content/uploads/2025/07/image2-2-png-e1752234784623.webp)
논문 링크 Helix Parallelism: 초장기 LLM 디코딩의 지연-처리량 벽을 깨다한 줄 요약 (TL;DR)Helix Parallelism은 Attention과 FFN을 서로 다른 병렬화 전략으로 스케줄링해 KV 캐시 중복과 FFN 가중치 로드 …
논문 링크 Subgoal Curriculum + CoT Consistency: DeepSeek-Prover-V2가 자동 정리 증명의 판을 갈아엎다TL;DRDeepSeek-Prover-V2는 “문제를 잘게 쪼개고, 쪼갠 대로 끝까지 맞춘다”는 원칙으로 …
논문 링크 Inference-Time Scaling: DeepSeek-GRM이 초대형 모델을 넘어선 비결한 줄 요약 (TL;DR)“27 B 모델 × 32배 샘플”—Generative Reward Model(GRM)과 k-Vote 합산만으로 …
논문 링크 CODE I/O: 코드 입·출력 + 자연어 CoT로 범용 추론까지 — 데이터 설계만으로 7B-30B LLM을 평균 +2 점 끌어올리다TL;DR“코드 함수 → 입력·출력 예측 + 체계적 Chain-of-Thought(CoT)”라는 단일 데이터 …
논문 링크 Native Sparse Attention (NSA) — 64 k 토큰도 11× 빠르게, 정확도는 그대로한 줄 요약 (TL;DR)NSA는 ‘압축 → 선택 → 슬라이딩’ 3 분기 희소 어텐션과 GQA/MQA-친화 커널을 결합해 64 k 컨텍스 …
아래 글은 gemini의 deep research를 이용하여 생성한 리포트입니다. 앞으로의 시대에서 2차전지는 전기차와 휴머노이드와 같은 산업에서 많은 수요가 있을것으로 예상이 됩니다. 그중에서도 데이터센터에 필요한 2차전지에 주목한다면(UPS/AI와 …