Inference & Optimization

매일 핵심 AI 뉴스 알림 받기

추론 및 최적화에 대한 기술적 연구를 다룹니다

DFlash는 어떻게 순차 생성의 벽을 깼나 LLM 응답 속도는 초안을 순차로 만드는 구간에서 막힌다. DFlash는 이 초안을 블록 단위로 한 번에 채워 같은 응답 속도로 처리 가능한 요청 수를 크게 늘렸다. · 5분