NVIDIA Mellanox MCX556A-ECAT সার্ভার অ্যাডাপ্টার অ্যাকশনে: RDMA/RoCE লো-ল্যাটেন্সি পারফরম্যান্স আনলক করা এবং AI ত্বরান্বিত করা

September 4, 2026

সর্বশেষ কোম্পানির খবর NVIDIA Mellanox MCX556A-ECAT সার্ভার অ্যাডাপ্টার অ্যাকশনে: RDMA/RoCE লো-ল্যাটেন্সি পারফরম্যান্স আনলক করা এবং AI ত্বরান্বিত করা

NVIDIA Mellanox MCX556A-ECAT সার্ভার অ্যাডাপ্টার ইন অ্যাকশন: RDMA/RoCE লো-লেটেন্সি পারফরম্যান্স আনলক করা এবং এআই এবং ডিস্ট্রিবিউটেড স্টোরেজ ওয়ার্কলোড ত্বরান্বিত করা

মডেল:MCX556A-ECAT| ব্র্যান্ড: NVIDIA Mellanox | বিভাগ: উচ্চ-পারফরম্যান্স ইথারনেট অ্যাডাপ্টার | মূল ক্ষমতা: RDMA/RoCE লো-লেটেন্সি ট্রান্সপোর্ট এবং সার্ভার থ্রুপুট অপ্টিমাইজেশান

পটভূমি এবং চ্যালেঞ্জ: বৃহৎ-স্কেল এআই প্রশিক্ষণে নেটওয়ার্ক বাধা

একটি নেতৃস্থানীয় স্বায়ত্তশাসিত ড্রাইভিং প্রযুক্তি কোম্পানির ডেটা অবকাঠামো দলের জন্য, এআই মডেল প্রশিক্ষণ কাজের চাপের দ্রুত বৃদ্ধি তাদের বিদ্যমান নেটওয়ার্ক অবকাঠামোর ক্ষমতাকে ছাড়িয়ে গেছে। তাদের কম্পিউট ক্লাস্টারে 200 টিরও বেশি GPU সার্ভার রয়েছে, প্রতিটি 25GbE অ্যাডাপ্টার দিয়ে সজ্জিত, সেন্সর এবং সিমুলেশন ডেটার পেটাবাইট হাউজিং ডিস্ট্রিবিউটেড স্টোরেজ সিস্টেমের সাথে সংযুক্ত। বড় মাপের প্রশিক্ষণের কাজের সময়, দলটি ধারাবাহিকভাবে দুটি জটিল সমস্যা পর্যবেক্ষণ করেছে: ডেটা লোডিং বাধার কারণে GPU ব্যবহার খুব কমই 70% ছাড়িয়ে গেছে, এবং চেকপয়েন্ট সেভিং অপারেশনগুলি - মডেল পুনরুদ্ধারের জন্য অপরিহার্য - 40 সেকেন্ডের বেশি সময় নেয়, উল্লেখযোগ্যভাবে পুনরাবৃত্তিমূলক প্রশিক্ষণ চক্রকে ধীর করে দেয়৷

মূল কারণটি নেটওয়ার্ক অ্যাক্সেস লেয়ারে সনাক্ত করা হয়েছিল: বিদ্যমান অ্যাডাপ্টারগুলিতে শক্তিশালী RDMA অফলোড ক্ষমতার অভাব ছিল, যা স্টোরেজ I/O কে TCP/IP স্ট্যাক অতিক্রম করতে এবং অতিরিক্ত CPU চক্র গ্রহণ করতে বাধ্য করে। এর ফলে উচ্চ টেল লেটেন্সি, GPU রিসোর্সের অদক্ষ ব্যবহার এবং ভবিষ্যতে ক্লাস্টার সম্প্রসারণের জন্য সীমাবদ্ধ পরিমাপযোগ্যতা। দলটির জরুরিভাবে একটি উচ্চ-পারফরম্যান্স অ্যাডাপ্টারের প্রয়োজন ছিল যা তাদের NVMe-oF স্টোরেজ ফ্যাব্রিকের সম্ভাব্যতা আনলক করতে সাব-5µs RDMA লেটেন্সি এবং সম্পূর্ণ লাইন-রেট থ্রুপুট সরবরাহ করতে পারে। এই অবিকল যেখানেNVIDIA Mellanox MCX556A-ECATমূল্যায়ন প্রক্রিয়ায় প্রবেশ করেছে।

সমাধান এবং স্থাপনা: MCX556A-ECAT-এর চারপাশে একটি RDMA-অপ্টিমাইজড ফ্যাব্রিক তৈরি করা

একটি পুঙ্খানুপুঙ্খ পর্যালোচনা পরেMCX556A-ECAT ডেটাশীটএবং এর বৈধতাMCX556A-ECAT স্পেসিফিকেশনঅভ্যন্তরীণ কর্মক্ষমতা বেঞ্চমার্কের বিপরীতে, আর্কিটেকচার দল একটি পর্যায়ক্রমে স্থাপনার কৌশল ডিজাইন করেছে। দMCX556A-ECAT ConnectX অ্যাডাপ্টার PCIe নেটওয়ার্ক কার্ডএটির ডুয়াল-পোর্ট 50GbE ক্ষমতা এবং পরিপক্ক ConnectX-5 ASIC এর জন্য নির্বাচিত হয়েছিল, যা পারফরম্যান্স, পাওয়ার দক্ষতা এবং ইকোসিস্টেম পরিপক্কতার আদর্শ ভারসাম্য প্রদান করে।

স্থাপনার কৌশল তিনটি মূল পর্যায় অনুসরণ করে:

  • পর্যায় 1 - পাইলট স্থাপনা (16 GPU নোড):দুটি MCX556A-ECAT অ্যাডাপ্টার প্রতি কম্পিউট নোডে ইনস্টল করা হয়েছিল, RoCEv2-সক্ষম পাতার সুইচগুলিকে আলাদা করার জন্য ডুয়াল-হোমড। টিম SR-IOV এর সাথে অ্যাডাপ্টারগুলিকে কনফিগার করেছে যাতে I/O স্টোরেজ এবং প্রশিক্ষণ যোগাযোগের জন্য ডেডিকেটেড ভার্চুয়াল ফাংশন বরাদ্দ করা হয়, QoS বিচ্ছিন্নতা নিশ্চিত করে।
  • পর্যায় 2 - স্টোরেজ ফ্যাব্রিক ইন্টিগ্রেশন:NVMe-oF স্টোরেজ লক্ষ্যগুলি RDMA-সক্ষম এন্ডপয়েন্টের বিজ্ঞাপন দেওয়ার জন্য কনফিগার করা হয়েছিল। RoCEv2 ট্র্যাফিকের জন্য ক্ষতিহীন পরিবহনের গ্যারান্টি দিতে ফ্যাব্রিক জুড়ে PFC এবং ECN সক্ষম করা হয়েছিল।
  • পর্যায় 3 – উৎপাদন সম্প্রসারণ (সমস্ত 200 GPU নোড):ইতিবাচক পাইলট ফলাফলের উপর ভিত্তি করে, স্থাপনা সমগ্র ক্লাস্টারে বাড়ানো হয়েছিল। দMCX556A-ECAT সামঞ্জস্যপূর্ণইকোসিস্টেম বিদ্যমান সার্ভার প্ল্যাটফর্ম, স্টোরেজ অ্যারে এবং সুইচ পরিকাঠামোর সাথে বিরামহীন একীকরণ নিশ্চিত করেছে।

স্থাপনা জুড়ে,MCX556A-ECAT ইথারনেট অ্যাডাপ্টার কার্ডব্যতিক্রমী প্লাগ-এন্ড-প্লে সরলতা প্রদর্শন করেছে। দলটি NVIDIA কালেকটিভ কমিউনিকেশনস লাইব্রেরি (NCCL) এর সাথে MLNX_OFED ড্রাইভার স্ট্যাকটি GPU-to-GPU এবং GPU-থেকে-স্টোরেজ যোগাযোগের নিদর্শনগুলির জন্য RDMA কর্মক্ষমতা অপ্টিমাইজ করার জন্য ব্যবহার করেছে।

পরিমাপযোগ্য ফলাফল: উল্লেখযোগ্য কর্মক্ষমতা লাভ এবং সম্পদ মুক্তি

পূর্ণ-স্কেল উত্পাদন স্থাপনার পরে, দলটি একাধিক সমালোচনামূলক মেট্রিক্স জুড়ে যথেষ্ট উন্নতি নথিভুক্ত করেছে। নীচের সারণীটি প্রবর্তনের আগে এবং পরে কর্মক্ষমতা তুলনা সংক্ষিপ্ত করেNVIDIA Mellanox MCX556A-ECAT:

মেট্রিক আগে (25GbE / TCP) পরে (MCX556A-ECAT / RoCE) উন্নতি
স্টোরেজ রিড লেটেন্সি (P99) ~18 µs ~4.2 µs 76% হ্রাস
চেকপয়েন্ট সেভ টাইম (200GB মডেল) ~41 সেকেন্ড ~11 সেকেন্ড 73% দ্রুত
GPU কার্যকরী ব্যবহার ~70% ~94% 24 শতাংশ পয়েন্ট
CPU ব্যবহার (স্টোরেজ I/O পাথ) ~38% ~12% 26% সিপিইউ ক্ষমতা মুক্ত

পরিমাণগত উন্নতির বাইরেও, দলটি প্রশিক্ষণের পুনরাবৃত্তির সময়ে একটি নাটকীয় হ্রাসের রিপোর্ট করেছে—প্রতি মডেলের গড় 4.2 দিন থেকে মাত্র 2.8 দিনে, নতুন স্বায়ত্তশাসিত ড্রাইভিং মডেলগুলির জন্য সামগ্রিক সময়ে বাজারের 33% ত্বরণের প্রতিনিধিত্ব করে। উপরন্তু, যখন মূল্যায়নMCX556A-ECAT মূল্যমালিকানার মোট খরচের বিপরীতে, উৎপাদন ব্যবহারের প্রথম দুই মাসের মধ্যে ROI বাধ্যতামূলক হয়ে ওঠে। মুক্ত CPU ক্ষমতা টিমকে পরিকল্পিত সার্ভার আপগ্রেডগুলিকে পিছিয়ে দেওয়ার অনুমতি দেয়, যেখানে প্রশিক্ষণের সময় হ্রাস সরাসরি প্রতিযোগিতামূলক সুবিধাতে রূপান্তরিত হয়। দMCX556A-ECAT বিক্রয়ের জন্যNVIDIA-এর চ্যানেল অংশীদারদের মাধ্যমে বিকল্পগুলি নমনীয় সংগ্রহের মডেলগুলি অফার করে যা কোম্পানির মূলধন ব্যয় চক্রের সাথে সামঞ্জস্যপূর্ণ।

সারাংশ এবং আউটলুক: ভবিষ্যতের এআই অবকাঠামোর জন্য একটি ভিত্তি

বাস্তব বিশ্বের দত্তকNVIDIA Mellanox MCX556A-ECATএই স্বায়ত্তশাসিত ড্রাইভিং পরিবেশে দেখায় যে RDMA/RoCE-সক্ষম সার্ভার সংযোগ আর বিলাসিতা নয় বরং আধুনিক AI কাজের চাপের জন্য প্রয়োজনীয়। দMCX556A-ECAT ইথারনেট অ্যাডাপ্টার কার্ড সমাধানস্টোরেজের বাধা দূর করার, GPU ব্যবহারকে সর্বাধিক করে তোলা এবং মডেল প্রশিক্ষণ চক্রকে উল্লেখযোগ্যভাবে ত্বরান্বিত করার ক্ষমতা প্রমাণ করেছে—সবকিছুই একীভূত, পরিচালনাযোগ্য নেটওয়ার্ক ফ্যাব্রিকের মধ্যে।

সামনের দিকে তাকিয়ে, দলটি দ্বারা সক্ষম অতিরিক্ত ব্যবহারের ক্ষেত্রে অন্বেষণ করার পরিকল্পনা করেছে৷MCX556A-ECAT ConnectX অ্যাডাপ্টার PCIe নেটওয়ার্ক কার্ড, রিয়েল-টাইম সেন্সর ডেটা স্ট্রিমিং এবং ফেডারেটেড শেখার জন্য মাল্টি-ক্লাস্টার সিঙ্ক্রোনাইজেশন সহ। দMCX556A-ECAT ডেটাশীটএবং বিকশিতMCX556A-ECAT স্পেসিফিকেশনতাদের রোডম্যাপ, বিশেষ করে প্রায় 100GbE প্রস্তুতি এবং উন্নত নিরাপত্তা অফলোড সম্পর্কে অবহিত করা চালিয়ে যান। যেহেতু আরও এন্টারপ্রাইজগুলি AI এবং HPC ডোমেনে অনুরূপ স্কেলিং চাপের সম্মুখীন হয়,MCX556A-ECATমিশন-গুরুত্বপূর্ণ পরিবেশে কর্মক্ষমতা, নির্ভরযোগ্যতা এবং অপারেশনাল সরলতার ভারসাম্যের জন্য একটি প্রমাণিত টেমপ্লেট অফার করে।