Make It Easy Do It Simple!
ក្រុមហ៊ុន Dongfang Suanxin (DFSX) របស់ចិន កំពុងភ្នាល់ថា memory bandwidth — មិនមែនការបង្រួមទំហំឈីបទេ — គឺជាគន្លឹះពិតប្រាកដសម្រាប់ការអនុវត្តន៍ AI ។
ខណៈដែល NVIDIA រត់ទៅមុខជាមួយបច្ចេកវិទ្យា node ថ្មីបំផុត DFSX ដើរផ្លូវខុសគ្នា។ ឈីប DF1000 និង DF2000 របស់ខ្លួនត្រូវបានសាងសង់លើដំណើរការ 14nm ប៉ុន្តែអាចសម្រេចបានសមិទ្ធផលគួរឱ្យចាប់អារម្មណ៍មួយ៖ memory bandwidth ទ្វេដងធៀបនឹងប្រព័ន្ធ GB200 NVL72 របស់ NVIDIA ។
នេះជាតួលេខសំខាន់៖ TY64 SuperNode ដែលប្រើឈីប DF2000 ផ្តល់ 960TB/s នៃ memory bandwidth ខណៈដែល GB200 NVL72 របស់ NVIDIA ផ្តល់ត្រឹម 576TB/s ។ ហើយ DFSX មិនឈប់ត្រឹមនេះទេ៖ ឈីប DF3000 ជំនាន់ក្រោយគ្រោងនឹងផ្តល់ 20TB/s ក្នុងមួយឈីប ឬ 1,280TB/s ក្នុងការកំណត់ TY64 ដែលជិតនឹងកម្រិត 1,580TB/s របស់ NVIDIA Vera Rubin NVL72 ។
អាថ៌កំបាំងស្ថិតនៅក្នុងស្ថាបត្យកម្ម មិនមែន node ទេ៖
គម្លាតនេះច្បាស់នៅក្នុងថាមពលគណនាសុទ្ធ។ TY64 SuperNode ដោយផ្អែកលើ DF2000 ផ្តល់ 64 PFLOPS នៃ BF16 compute ធៀបនឹង 360 PFLOPS របស់ GB200 NVL72 ។ នោះគឺខុសគ្នាប្រហែល 5.6 ដង។
ប៉ុន្តែ DFSX អះអាងថា FLOPS គឺជារង្វាស់ខុស។ នៅពេល LLM ធំៗកាន់តែធំឡើងៗ ដែនកំណត់ពិតប្រាកដបានផ្លាស់ប្តូរពីការគណនាក្នុងមួយឈីប ទៅជាទំហំអង្គចងចាំ memory bandwidth ល្បឿនតភ្ជាប់ និងការរួមបញ្ចូលប្រព័ន្ធ។ GPU នៅស្ងៀមរង់ចាំទិន្នន័យ — “ជញ្ជាំងអង្គចងចាំ” (memory wall) គឺជាដែនកំណត់ មិនមែន transistor ទេ។

ការភ្នាល់របស់ DFSX គឺច្បាស់៖ memory bandwidth ទ្វេដងអាចប៉ះប៉ូវគម្លាតថាមពលគណនាសុទ្ធបាន សម្រាប់បន្ទុកការងារ AI inference ។ ហើយប្រសិនបើពួកគេត្រូវ នេះនឹងប្រឈមនឹងការជាប់ជំពាក់របស់ឧស្សាហកម្មលើការបង្រួម node — បង្ហាញថាការវេចខ្ចប់ឆ្លាតវៃ និងស្ថាបត្យកម្មអង្គចងចាំអាចផ្តល់សេដ្ឋកិច្ចនៃទំហំដោយមិនដេញតាម node ថ្មីបំផុត។
DF3000 គឺជារឿងដែលត្រូវតាមដាន។ ជាមួយ 1,280TB/s ក្នុង TY64 SuperNode — ដែលយឺតជាង NVIDIA Vera Rubin ត្រឹម 23% — DFSX កំពុងបង្ហាញសញ្ញាថាអ្នករចនាឈីបរបស់ចិនអាចប្រកួតប្រជែងបានតាមរយៈស្ថាបត្យកម្មឆ្លាតវៃ សូម្បីតែស្ថិតក្រោមឧបស័ក្ខតាម node ក៏ដោយ។