![]() |
| Image: NVIDIA |
Nvidia က ဒီအပတ်အတွင်း သူတို့ရဲ့ လာမယ့် Vera data center CPU အကြောင်း အသေးစိတ် အချက်အလက်တွေကို ထပ်မံထုတ်ဖော် ပြသခဲ့ပါတယ်။ ဒီထဲမှာ agentic AI လုပ်ငန်းတွေအတွက် အထူးတလည် ဒီဇိုင်းဆွဲထားတဲ့ စိတ်ကြိုက် Olympus core တွေရဲ့ အဓိကအချက်အလက်တွေ ပါဝင်ပါတယ်။ ဒါ့အပြင် ဒီ architecture အသစ်ဟာ ပြိုင်ဘက် ထုတ်ကုန်တွေထက် ပိုမိုမြန်ဆန်တဲ့ single-core စွမ်းဆောင်ရည်ကို ပေးစွမ်းနိုင်တယ်လို့လည်း Nvidia က ဆိုပါတယ်။
![]() |
| Image: NVIDIA |
Nvidia ရဲ့ Vera Rubin ပလက်ဖောင်းရဲ့ တစ်စိတ်တစ်ပိုင်းဖြစ်တဲ့ Arm အခြေပြု Vera CPU ကို AI agent တွေအတွက် reasoning တွေ လုပ်ဆောင်ဖို့၊ tool execution တွေကို အဆင်ပြေချောမွေ့စေဖို့၊ code တွေ ရေးသားပေးဖို့နဲ့ AI အေးဂျင့်တွေအတွက် လုပ်ငန်းတာဝန်တွေကို ရေးဆွဲပေးဖို့ ဒီဇိုင်းထုတ်ထားတာ ဖြစ်ပါတယ်။ ဒီချစ်ပ်ကို ဘက်စုံသုံး chip တစ်ခုအဖြစ် တည်ဆောက်ထားတာကြောင့် ပုံမှန် AI လုပ်ငန်းတွေထက် CPU စွမ်းအား ပိုပြီးလိုအပ်တဲ့ သိပ္ပံနည်းကျ ဒေတာလုပ်ဆောင်မှုနဲ့ reinforcement learning လိုမျိုး အလုပ်တွေကိုပါ ကိုင်တွယ်နိုင်ပါတယ်။
![]() |
| Image: NVIDIA |
Vera CPU တစ်ခုစီမှာ Olympus cores ၈၈ ခု၊ physical threads ၁၇၆ ခု၊ 64KB four-way L1 instruction cache နဲ့ 164MB unified L3 cache တို့ကို compute die တစ်ခုတည်းပေါ်မှာ ပေါင်းစပ်တပ်ဆင်ထားပါတယ်။ ဒါ့အပြင် 48-instruction decode queue လည်း ပါဝင်ပါတယ်။ core ရဲ့ အလယ်ပိုင်း mid-core မှာတော့ 96KB six-way L1 data cache နဲ့ 2MB eight-way L2 cache တို့ ပါဝင်ပြီး ဒေတာပမာဏများပြားတဲ့ graph နဲ့ analytics လုပ်ငန်းစဉ်တွေအတွက် hardware graph prefetcher စနစ်ကိုပါ ထည့်သွင်းပေးထားပါတယ်။
Custom core တစ်ခုစီမှာတော့ သီးသန့် အစိတ်အပိုင်းတွေ ပါဝင်ပါတယ်။ အဲဒါတွေကတော့ branch prediction စနစ်ကို အကောင်းဆုံးပြင်ဆင်ထားတဲ့ wide front-end၊ အရေးကြီးတဲ့ လုပ်ငန်းစဉ်လမ်းကြောင်းတွေကို အရှိန်မြှင့်ပေးမယ့် mid-core နဲ့ ရှုပ်ထွေးတဲ့ vector တွက်ချက်မှုတွေကို အကောင်းဆုံး မွမ်းမံပေးနိုင်တဲ့ execution engine တို့ပဲ ဖြစ်ပါတယ်။ ဒီ core တွေဟာ cycle တစ်ခုမှာ instruction ၁၆ ခုအထိ ထောက်ပံ့ပေးနိုင်တဲ့ high-bandwidth instruction fetch စနစ် ပါဝင်ပြီး cycle တစ်ခုမှာ ပေါင်းစည်းထားတဲ့ instruction ၁၀ ခုအထိ စီမံပေးနိုင်တဲ့ 10-wide decode engine တစ်ခုလည်း ပါဝင်ပါတယ်။
![]() |
| Image: NVIDIA |
Olympus ရဲ့ branch prediction စနစ်မှာ သီးသန့် branch pattern တွေကြောင့် လမ်းကြောင်းမှားယွင်းတွက်ချက်မိတာမျိုးကို လျှော့ချပေးနိုင်တဲ့ neural branch predictor ပါဝင်ပါတယ်။ ဒါဟာ Wide decode path နဲ့ ပေါင်းစပ်လိုက်တဲ့အခါ Agentic AI နဲ့ Reinforcement Learning လိုမျိုး latency တိုတောင်းဖို့ လိုအပ်တဲ့ လုပ်ငန်းစဉ်တွေအတွက် front-end throughput ကို ပိုမိုကောင်းမွန်စေပါတယ်။
Olympus core architecture မှာ Nvidia ရဲ့ Spatial Multithreading နည်းပညာကို ပေါင်းစပ်ပေးထားတာကြောင့် စက်ရဲ့ လုပ်ဆောင်နိုင်စွမ်း အရင်းအမြစ် (resource) တွေကို လိုက်လျောညီထွေ ခွဲဝေအသုံးပြုနိုင်စွမ်း ရှိပါတယ်။ ဒါ့အပြင် die ပေါ်ရှိ core အချင်းချင်း ချိတ်ဆက်မှုကို Bandwidth 3.4 TB/s အထိ ထောက်ပံ့ပေးနိုင်တဲ့ Scalable Coherency Fabric စနစ်၊ စုစုပေါင်း 1.2 TB/s ရရှိမယ့် SOCAMM2 LPDDR5X memory bandwidth နဲ့ မန်မိုရီပမာဏ 1.5 TB အထိကိုပါ ထောက်ပံ့ပေးထားပါတယ်။
Vera CPU ဟာ NVLink-C2C၊ PCIe 6.4 နဲ့ CXL 3.1 စနစ်တွေပေါ်မှာ 1.8 TB/s ချိတ်ဆက်မှုကို ထောက်ပံ့ပေးထားပါတယ်။ Socket တစ်ခုစီမှာ PCIe Gen 6 lanes ၁၇၆ ခုအထိ ပါဝင်ပြီး dual-socket စနစ်အထိ ချဲ့ထွင်အသုံးပြုနိုင်ပါတယ်။ Dual-socket စနစ်တွေမှာ ဖြစ်တတ်တဲ့ latency ကို လျှော့ချဖို့အတွက် Vera ဟာ socket တစ်ခုစီကို NUMA domain တစ်ခုတည်းအဖြစ် ဖော်ပြပေးတဲ့ software အခြေပြုနည်းလမ်းကို အသုံးပြုထားတာကြောင့် fragmentation မှုကို ရှောင်ရှားနိုင်ပြီး သန့်ရှင်းတဲ့ NUMA-node နှစ်ခုပါဝင်တဲ့ တည်ဆောက်ပုံစနစ်ကို ဖန်တီးပေးထားပါတယ်။
Note: En Thue Tech ၏ သတင်းဆောင်းပါးများကို ခွင့်ပြုချက်မရှိဘဲ တစ်စိတ်တစ်ပိုင်းဖြစ်စေ၊ အပြည့်အစုံဖြစ်စေ ပြန်လည်ကူးယူဖော်ပြခွင့်မပြုပါ။
Source: TechSpot




0 Comments