Představujeme Falcon: spolehlivý přenos hardwaru s nízkou latencí | Blog Google Cloud
Ve společnosti Google máme dlouhou historii řešení problémů ve velkém pomocí Ethernetu a přehodnocování transportní vrstvy, abychom uspokojili náročné pracovní zátěže, které vyžadují velkou šířku pásma, vysokou rychlost zpráv a nízkou latenci. Pracovní zátěže, jako je úložiště, potřebovaly některé z těchto atributů již dlouhou dobu, avšak s novějšími případy použití, jako je masivní školení AI/ML a high performance computing (HPC), potřeba výrazně vzrostla. V minulosti jsme otevřeně sdíleli naše poznatky v oblasti tvarování provozu, řízení přetížení, vyvažování zátěže a dalších s průmyslem tím, že jsme svými nápady přispěli Asociace pro výpočetní stroje a internetové inženýrství Task Force. Tyto myšlenky byly během několika let implementovány v softwaru a několik v hardwaru. Ale do budoucna věříme, že průmysl jako celek zaznamená více zisků implementací sady s vyhrazenou a flexibilní hardwarovou podporou.
Abychom tohoto cíle dosáhli, vyvinuli jsme Falcon, který umožňuje skokovou funkci ve výkonu oproti pouze softwarovým transportům. Dnes na globálním summitu OCP jsme nadšeni, že můžeme Falcon otevřít ekosystému prostřednictvím projektu Open Compute Project, což je přirozené místo, které komunitě umožní získat poznatky z produkce společnosti Google, které pomohou modernizovat Ethernet.
Jako hardwarově podporovaná transportní vrstva je Falcon navržen tak, aby byl spolehlivý, vysoce výkonný a s nízkou latencí a využívá produkčně ověřené technologie včetně Carousel, Snap, Swift, PLB a CSIG.

Falconovy vrstvy jsou znázorněny na obrázku níže, včetně jejich související funkce. Ukazujeme protokoly RDMA a NVM Express™ Upper Layer (ULP), avšak Falcon je rozšiřitelný na další ULP podle potřeby ekosystému.

Nižší vrstvy Falconu využívají tři klíčové poznatky k dosažení nízké latence v širokopásmových, ale ztrátových ethernetových sítích datových center. Jemná hardwarově podporovaná měření času (RTT) s flexibilním hardwarově vynuceným tvarováním provozu podle toku a rychlým a přesným opakovaným přenosem paketů jsou kombinována s připojením Falcon s podporou více cest a šifrováním PSP. Kromě tohoto základu byl Falcon od základu navržen jako multiprotokolový transport schopný podporovat ULP s velmi rozdílnými požadavky na výkon a sémantikou aplikací. Mapovací vrstva ULP poskytuje nejen okamžitou kompatibilitu s Infiniband Verbs RDMA a NVMe ULP, ale zahrnuje také další inovace kritické pro aplikace ve skladovém měřítku, jako je flexibilní sémantika řazení a elegantní zpracování chyb. V neposlední řadě jsou hardware a software navrženy tak, aby spolupracovaly, aby pomohly dosáhnout požadovaných atributů vysoké rychlosti zpráv, nízké latence a velké šířky pásma při zachování flexibility pro programovatelnost a neustálé inovace.
Falcon odráží ústřední roli, kterou Ethernet v našem odvětví nadále hraje. Falcon je navržen pro předvídatelný vysoký výkon ve skladovém měřítku, stejně jako flexibilitu a rozšiřitelnost. Těšíme se na spolupráci s komunitou a průmyslovými partnery na modernizaci Ethernetu, aby vyhovoval síťovým požadavkům naší budoucnosti založené na umělé inteligenci. Věříme, že Falcon bude cenným přírůstkem k dalším probíhajícím snahám v tomto prostoru.
Perspektivy odvětví
Naši partneři v celém odvětví jsou nadšeni příslibem, který Falcon drží při vývoji další generace Ethernetu.
„Vítáme příspěvek společnosti Falcon od společnosti Google, protože sdílí vizi Ultra Ethernet Consortium prosadit Ethernet jako nejlepší strukturu datových center pro AI a HPC, a těšíme se na pokračující průmyslové inovace v tomto důležitém prostoru.“ — Dr. J Metz, Chair, Ultra Ethernet Consortium (vedené AMD, Arista, Broadcom, Cisco, Eviden, Hewlett Packard Enterprise, Intel, Meta, Microsoft a Oracle)
„Falcon je první dostupný v řadě produktů Intel IPU E2000. Hodnota těchto IPU je dále posílena jako první instance ethernetového přenosu, aby se přidala nízká latence a řešení přetížení v měřítku. Intel je řídícím členem konsorcia Ultra Ethernet, které pracuje na vývoji Ethernetu pro vysoce výkonné pracovní zátěže AI a HPC. Plánujeme nasadit výsledná vylepšení založená na standardech v budoucích produktech IPU a Ethernet. — Sachin Katti, SVP & GM, Network and Edge Group, Intel
„Jsme rádi, že vidíme vysoce výkonný transportní protokol pro kritická pracovní zatížení, jako je AI a HPC, který funguje přes standardní sítě Ethernet/IP a umožňuje masivní aplikační šířku pásma ve velkém měřítku.“ — Hugh Holbrook, viceprezident skupiny, SW Eng., Arista Networks
„Cisco s potěšením vidí přínos Falconu pro OCP. Cisco dlouhodobě podporuje otevřené standardy a věří v široké ekosystémy. Rychlost a rozsah moderních sítí datových center a zejména sítí AI/ML je bezprecedentní, což představuje výzvu a příležitost pro toto odvětví. Falcon řeší mnoho výzev těchto sítí a umožňuje efektivní využití sítě. — Ofer Iny, Cisco Fellow, Cisco
„Juniper je silným zastáncem otevřených ekosystémů, a proto nás těší, že se Falcon otevírá komunitě OCP. Falcon umožňuje Ethernetu sloužit jako síť datových center dle výběru pro náročné pracovní zátěže, poskytuje velkou šířku pásma, nízkou latenci a zmírňuje přetížení. Falcon dnes poskytuje průmyslu osvědčené řešení pro náročné pracovní zátěže AI a ML. — Raj Yavatkar, technický ředitel, Juniper
„Marvell silně podporuje otevřený ethernetový ekosystém, který se vyvíjí, aby podporoval vznikající a náročné pracovní zátěže, jako je umělá inteligence, a zavázala se k němu. Oceňujeme přínos Falconu k OCP a vítáme sdílení praktických zkušeností společnosti Google s tímto odvětvím.“ — Nick Kucharewski, SVP & GM Network Switching Group, Marvell
Zjistit více
Networking je základní složkou při budování udržitelné, bezpečné a škálovatelné společenské infrastruktury, kterou potřebujeme pro tuto budoucnost řízenou umělou inteligencí. Chcete-li se o Falconu dozvědět více, připojte se k nám na prezentaci OCP Summit nazvanou „Spolehlivý ethernetový přenos hardwaru s nízkou latencí“ od Nandity Dukkipati z Googlu v 11:45 v hale Expo. Specifikace Falcon přispějeme do OCP v prvním čtvrtletí roku 2024.
Chcete-li se dozvědět více o příspěvcích společnosti Google k projektu Open Compute Project a naší přítomnosti na globálním summitu OCP, podívejte se na blog „Jak vybudujeme udržitelnou, škálovatelnou a bezpečnou infrastrukturu pro budoucnost řízenou umělou inteligencí“.