독립리서치
셀레브라스(Cerebras) "LLM 추론 속도 핵심은 GPU 연산력이 아니다"
💻 셀레브라스(Cerebras) "LLM 추론 속도 핵심은 GPU 연산력이 아니다"
SRAM 사용으로 셀레브라스가 어떻게 LLM 추론 속도를 낮출 수 있는지, 인터뷰 영상을 통해 인사이트를 얻어가시기 바랍니다.
📌 LLM 추론 병목은 ‘Decode’
추론은 프롬프트를 처리하는 Prefill과 답변을 한 토큰씩 만드는 Decode 단계로 구분
Prefill은 병렬처리가 가능하지만 Decode는 토큰을 하나씩 순차 생성
📌 GPU는 매 토큰마다 HBM에서 가중치 이동
토큰 생성 때마다 모델 가중치를 HBM에서 연산부로 불러와야 함
대형 모델일수록 이 데이터 이동이 중요
📌 Cerebras는 SRAM으로 병목 축소
웨이퍼 스케일 칩에 대규모 SRAM을 분산 배치해 가중치를 연산부 가까이에 둠
회사 설명 기준 가중치 이동 속도는 GPU 대비 약 2,500배
📌 핵심은 연산력이 아니라 메모리 구조
LLM 추론은 FLOPS보다 가중치를 얼마나 빨리 공급하느냐가 중요
AI 추론 경쟁의 병목이 Compute→Memory Movement로 이동 중
💻반도체 소부장💻[그로쓰리서치]
https://telegram.me/growth_semi
Telegram
💻반도체 소부장💻[그로쓰리서치]
✅“AI 반도체 시대, 소재·부품·장비의 리서치 채널”✅ 채널이 다루는 핵심 영역 ① 소재 (Materials) ② 부품 (Components) ③ 장비 (Equipment) “복잡한 반도체 공급망을 쉽게 번역한다”
외부 자료를 정리한 참고자료이며 투자 권유가 아닙니다. 기사·리포트의 저작권은 원저작자에게 있습니다. · 게시중단 요청