본문으로 건너뛰기
김신건의 로그

분산 학습, Data/Tensor/Pipeline Parallelism

큰 모델을 여러 GPU 에 나누는 3가지 기본 전략. Data Parallelism (배치 분할), Tensor Parallelism (한 layer 분할), Pipeline Parallelism (layer 들 수직 분배). 대규모 모델은 셋 다 조합.

메타데이터

ID distributed-training
카테고리 architecture
버전 v4
길이 14.0s (14000ms)
구성 21 elements · 6 chapters · 6 effects
태그 #distributed-training #parallelism #ai #gpu

본문에 삽입

```anim:distributed-training
{}
```

이 애니메이션을 사용하는 글 (1)

사이트 검색 / 명령어

검색

스크롤 = 확대/축소 · 드래그 = 이동 · 0 = 원래 크기 · ESC = 닫기