1. CUDA 1,500줄로 만든 추론 엔진, 전체 지도
jmaczan/tiny-vllm 은 Llama 3.2 1B Instruct 를 GPU 에서 돌리는 추론 엔진을 C++ 와 CUDA 로 처음부터 짠 저장소다. PyTorch 도, Hugging Face 도, 심지어 토크나이저도 쓰지 않는다. …
jmaczan/tiny-vllm 은 Llama 3.2 1B Instruct 를 GPU 에서 돌리는 추론 엔진을 C++ 와 CUDA 로 처음부터 짠 저장소다. PyTorch 도, Hugging Face 도, 심지어 토크나이저도 쓰지 않는다. …
논문 링크 StepAudio 3 Gen: 이산 자회귀(RVQ) 하나로 음성·노래·음악·효과음을 통합하다한 줄 요약 (TL;DR)StepFun이 발표한 StepAudio 3 Gen 은 12.5 Hz 프레임률의 $16 \times 2048$ 잔차 벡터 양 …
논문 링크 “무손실” 스페큘레이티브 디코딩은 정말 무손실일까? — Orthrus 재현으로 드러난 수치 정밀도의 함정TL;DR — Orthrus는 frozen AR 백본에 diffusion 뷰를 얹어 여러 토큰을 병렬로 생성하며 …
논문 링크 ZGCM-1: 7B 밀집 모델이 235B 프런티어와 겨루는 법 — 완전 개방형·초고효율 파운데이션 모델 설계 보고서TL;DR — ZGCM-1은 7.39B 밀집(dense) 모델 하나로 AIME 2026 75.0%, WebWalkerQA …
논문 링크 Programmable World Model — 생성형 월드에 “실행 가능한 상태"를 심다한 줄 요약 (TL;DR)비디오 월드 모델은 점점 더 사실적인 인터랙티브 환경을 만들어내지만, 화면에 잠깐 스친 픽셀만 기억할 뿐 …