10/09/2026
DFSX-DF1000-3.5D-Chiplet-Packaging-3D-DRAM-China-_6

ក្រុមហ៊ុន Dongfang Suanxin (DFSX) របស់ចិន កំពុងភ្នាល់ថា memory bandwidth — មិនមែនការបង្រួមទំហំឈីបទេ — គឺជាគន្លឹះពិតប្រាកដសម្រាប់ការអនុវត្តន៍ AI ។

ខណៈដែល NVIDIA រត់ទៅមុខជាមួយបច្ចេកវិទ្យា node ថ្មីបំផុត DFSX ដើរផ្លូវខុសគ្នា។ ឈីប DF1000 និង DF2000 របស់ខ្លួនត្រូវបានសាងសង់លើដំណើរការ 14nm ប៉ុន្តែអាចសម្រេចបានសមិទ្ធផលគួរឱ្យចាប់អារម្មណ៍មួយ៖ memory bandwidth ទ្វេដងធៀបនឹងប្រព័ន្ធ GB200 NVL72 របស់ NVIDIA ។

នេះជាតួលេខសំខាន់៖ TY64 SuperNode ដែលប្រើឈីប DF2000 ផ្តល់ 960TB/s នៃ memory bandwidth ខណៈដែល GB200 NVL72 របស់ NVIDIA ផ្តល់ត្រឹម 576TB/s ។ ហើយ DFSX មិនឈប់ត្រឹមនេះទេ៖ ឈីប DF3000 ជំនាន់ក្រោយគ្រោងនឹងផ្តល់ 20TB/s ក្នុងមួយឈីប ឬ 1,280TB/s ក្នុងការកំណត់ TY64 ដែលជិតនឹងកម្រិត 1,580TB/s របស់ NVIDIA Vera Rubin NVL72 ។

របៀបដែល DFSX ធ្វើបាន

អាថ៌កំបាំងស្ថិតនៅក្នុងស្ថាបត្យកម្ម មិនមែន node ទេ៖

  • DF1000 ប្រើការរចនា 3D near-memory compute — អង្គចងចាំត្រូវបានដាក់ជង់លើស្រទាប់គណនាដោយផ្ទាល់ ហើយភ្ជាប់តាមរយៈ 3D wafer-level hybrid bonding ដែលបញ្ចូលគ្នានូវផ្លូវស្ពាន់នៃស្រទាប់ទាំងពីរ។ វិធីនេះលុបបំបាត់ microbumps និងខ្សែតភ្ជាប់ទាំងស្រុង ដោយដើរតួដូចជា “ជណ្តើរយន្តបញ្ឈរល្បឿនលឿនរាប់សិបលាន” ជំនួសឱ្យផ្លូវហាយវេផ្ដេកតែមួយ។
  • DF2000 (គ្រោងចេញ Q4 2026) ទៅមុខមួយជំហានទៀតជាមួយ “3.5D Infinity Chiplet layout” — ដាក់ memory-compute towers ច្រើនជង់ភ្ជាប់គ្នាលើគ្រឹះមួយ ជាមួយការរចនា 3D DRAM ផ្ទាល់ខ្លួន ដែលបង្កើនសមត្ថភាពផ្ទុកទិន្នន័យបណ្ដោះអាសន្នក្នុងឈីបយ៉ាងច្រើន។

ការដោះដូរ៖ ថាមពលគណនាសុទ្ធ

គម្លាតនេះច្បាស់នៅក្នុងថាមពលគណនាសុទ្ធ។ TY64 SuperNode ដោយផ្អែកលើ DF2000 ផ្តល់ 64 PFLOPS នៃ BF16 compute ធៀបនឹង 360 PFLOPS របស់ GB200 NVL72 ។ នោះគឺខុសគ្នាប្រហែល 5.6 ដង។

ប៉ុន្តែ DFSX អះអាងថា FLOPS គឺជារង្វាស់ខុស។ នៅពេល LLM ធំៗកាន់តែធំឡើងៗ ដែនកំណត់ពិតប្រាកដបានផ្លាស់ប្តូរពីការគណនាក្នុងមួយឈីប ទៅជាទំហំអង្គចងចាំ memory bandwidth ល្បឿនតភ្ជាប់ និងការរួមបញ្ចូលប្រព័ន្ធ។ GPU នៅស្ងៀមរង់ចាំទិន្នន័យ — “ជញ្ជាំងអង្គចងចាំ” (memory wall) គឺជាដែនកំណត់ មិនមែន transistor ទេ។

ហេតុអ្វីបានជារឿងនេះសំខាន់

ការភ្នាល់របស់ DFSX គឺច្បាស់៖ memory bandwidth ទ្វេដងអាចប៉ះប៉ូវគម្លាតថាមពលគណនាសុទ្ធបាន សម្រាប់បន្ទុកការងារ AI inference ។ ហើយប្រសិនបើពួកគេត្រូវ នេះនឹងប្រឈមនឹងការជាប់ជំពាក់របស់ឧស្សាហកម្មលើការបង្រួម node — បង្ហាញថាការវេចខ្ចប់ឆ្លាតវៃ និងស្ថាបត្យកម្មអង្គចងចាំអាចផ្តល់សេដ្ឋកិច្ចនៃទំហំដោយមិនដេញតាម node ថ្មីបំផុត។

DF3000 គឺជារឿងដែលត្រូវតាមដាន។ ជាមួយ 1,280TB/s ក្នុង TY64 SuperNode — ដែលយឺតជាង NVIDIA Vera Rubin ត្រឹម 23% — DFSX កំពុងបង្ហាញសញ្ញាថាអ្នករចនាឈីបរបស់ចិនអាចប្រកួតប្រជែងបានតាមរយៈស្ថាបត្យកម្មឆ្លាតវៃ សូម្បីតែស្ថិតក្រោមឧបស័ក្ខតាម node ក៏ដោយ។

Leave a Reply

Your email address will not be published. Required fields are marked *