Голям модел не се учи на един чип, а на хиляди, които непрекъснато си говорят, и тази мрежа между тях тежи колкото самите чипове. Струва си да го знаеш, защото обяснява защо компаниите харчат милиарди не само за чипове, а и за връзките между тях.
Защо хиляди чипове си говорят
Обучението на голям модел се дели на парчета между хиляди чипове и всеки държи част от изчислението. На определена стъпка всички трябва да съберат каквото са пресметнали, да го обединят на едно място и после всеки да получи обратно общия резултат, за да продължи. Това събиране и разпращане се нарича колективна операция. Всички участват едновременно и никой не може да продължи, докато последният не свърши своята част.
Именно затова загубен пакет данни тук е скъп по начин, който не важи за обикновения интернет. Вкъщи, ако страница се зареди половин секунда по-бавно, не забелязваш. В клъстер от хиляди чипове, ако един пакет се загуби и трябва да се прати наново, целият разговор спира и хиляди чипа седят и чакат единствения, който не е получил своето парче.
Кой прибра числото
Meta вградиха дванадесет мрежови карти направо в своя чип за обучение MTIA 300, вместо да ги държат отделно на платката. По техни данни спадът в скоростта заради паралелната комуникация падна под половин процент, докато в обичайните клъстери същият спад минава двадесет процента.
Същата компания написа и собствен протокол за връзка между чиповете, MetaRoCE, и го отвори публично през Open Compute Project, за да могат и други да го проверят сами, вместо да им вярват на думата. Това е втората половина от историята и тя се повтаря често: който строи много голямо, накрая си пише и мрежата.