분산 학습, Data/Tensor/Pipeline Parallelism
큰 모델을 여러 GPU 에 나누는 3가지 기본 전략. Data Parallelism (배치 분할), Tensor Parallelism (한 layer 분할), Pipeline Parallelism (layer 들 수직 분배). 대규모 모델은 셋 다 조합.
메타데이터
| ID | distributed-training |
| 카테고리 | architecture |
| 버전 | v4 |
| 길이 | 14.0s (14000ms) |
| 구성 | 21 elements · 6 chapters · 6 effects |
| 태그 | #distributed-training #parallelism #ai #gpu |
본문에 삽입
```anim:distributed-training
{}
```