NVIDIA Mellanox MQM8790-HS2F ইনফিনিব্যান্ড সুইচ কার্যক্ষেত্রে: RDMA/HPC/AI ক্লাস্টারের জন্য লো-ল্যাটেন্সি ইন্টারকানেক্ট অপ্টিমাইজ করা
August 21, 2026
অ্যাকশনে NVIDIA Mellanox MQM8790-HS2F InfiniBand সুইচ: RDMA/HPC/AI ক্লাস্টারের জন্য লো-লেটেন্সি ইন্টারকানেক্ট অপ্টিমাইজ করা
বৃহৎ আকারের এআই মডেল প্রশিক্ষণ এবং উচ্চ-কার্যকারিতা কম্পিউটিং (HPC) এর ক্ষেত্রে, নেটওয়ার্ক লেটেন্সি প্রায়শই একটি গুরুতর বাধা হয়ে দাঁড়ায় যা ক্লাস্টারের স্কেলেবিলিটি এবং দক্ষতা সীমিত করে। একটি জাতীয়-স্তরের সুপারকম্পিউটিং সেন্টার সম্প্রতি একটি বড় অবকাঠামো আপগ্রেড সম্পন্ন করেছে, একটি 100Gb/s EDR InfiniBand ফ্যাব্রিক থেকে 200Gb/s HDR সমাধানে স্থানান্তরিত হয়েছে যা NVIDIA Mellanox MQM8790-HS2F InfiniBand সুইচের উপর ভিত্তি করে তৈরি। এই কেস স্টাডিটি তারা যে চ্যালেঞ্জগুলির সম্মুখীন হয়েছিল, স্থাপনার কৌশল এবং এই পরবর্তী প্রজন্মের ইন্টারকানেক্টের মাধ্যমে অর্জিত পরিমাপযোগ্য কর্মক্ষমতা লাভগুলি পরীক্ষা করে।
পটভূমি এবং চ্যালেঞ্জ: যখন লেটেন্সি পারফরম্যান্সের সীমা হয়ে দাঁড়ায়
সুপারকম্পিউটিং সেন্টারটি 2,000 টিরও বেশি GPU নোড সমন্বিত একটি ভিন্নধর্মী ক্লাস্টার পরিচালনা করে, যা আবহাওয়া সিমুলেশন, জিনোমিক গবেষণা এবং বৃহৎ ভাষা মডেল প্রশিক্ষণ সহ বিভিন্ন কাজের মিশ্রণকে সমর্থন করে। পূর্ববর্তী 100Gb/s EDR নেটওয়ার্কের সাথে, অপারেশন টিম লক্ষ্য করেছে যে নোডের সংখ্যা বৃদ্ধির সাথে সাথে কালেক্টিভ কমিউনিকেশন অপারেশনস—যেমন অল-রিডিউস এবং অল-গ্যাদার—মোট কাজের রানটাইমের একটি ক্রমবর্ধমান অংশ গ্রহণ করছিল। কিছু ডিস্ট্রিবিউটেড ট্রেনিং জবে, নেটওয়ার্ক-সম্পর্কিত ওভারহেড এন্ড-টু-এন্ড এক্সিকিউশন সময়ের প্রায় 40% এর জন্য দায়ী ছিল, যা GPU ব্যবহারকে মারাত্মকভাবে সীমিত করে এবং মডেল কনভারজেন্স চক্রকে দীর্ঘায়িত করে।
অতিরিক্ত চ্যালেঞ্জগুলির মধ্যে ছিল:
- কনজেশন হটস্পট:এআই প্রশিক্ষণে ট্র্যাফিক প্যাটার্ন প্রায়শই বার্স্টি এবং অপ্রত্যাশিত হয়, যা হেড-অফ-লাইন ব্লকিং এবং টেইল লেটেন্সি স্পাইক সৃষ্টি করে যা জব শিডিউলিংকে ব্যাহত করে।
- অপর্যাপ্ত ইন-নেটওয়ার্ক অ্যাক্সিলারেশন:লিগ্যাসি ফ্যাব্রিক উন্নত কালেক্টিভ অফলোড ক্ষমতাগুলির জন্য সমর্থন ছাড়াই ছিল, যার ফলে সমস্ত রিডাকশন অপারেশন হোস্ট সিপিইউ এবং মেমরি হায়ারার্কি অতিক্রম করতে বাধ্য হয়।
- ব্যবস্থাপনার জটিলতা:পারফরম্যান্স সমস্যা সমাধানের জন্য একাধিক মনিটরিং টুলের ম্যানুয়াল বিশ্লেষণের প্রয়োজন ছিল, যা বৃহৎ-মাপের স্থাপনায় মূল কারণগুলি চিহ্নিত করা কঠিন করে তোলে।
একাধিক ইন্টারকানেক্ট বিকল্পগুলি মূল্যায়ন করার পরে, সেন্টারটি তার নতুন ফ্যাব্রিকের ভিত্তি হিসাবে MQM8790-HS2F নির্বাচন করেছে। MQM8790-HS2F ডেটাশিট অনুসারে, এই সুইচটি 40টি 200Gb/s HDR নন-ব্লকিং থ্রুপুট পোর্ট, সাব-130ns কাট-থ্রু লেটেন্সি এবং SHARP v3.0 কালেক্টিভ অফলোডের সমর্থন সরবরাহ করে—এই ক্ষমতাগুলি সরাসরি তাদের মূল সমস্যাগুলির সমাধান করেছে।
সমাধান এবং স্থাপন: এআই/এইচপিসি-এর জন্য একটি লো-লেটেন্সি ফ্যাব্রিক তৈরি করা
স্থাপনায় একটি দ্বি-স্তরীয় ফ্যাট-ট্রি টপোলজি গ্রহণ করা হয়েছিল, যেখানে 24টি MQM8790-HS2F 200Gb/s HDR 40-পোর্ট QSFP56 সুইচ লিফ নোড হিসাবে এবং 8টি ইউনিট স্পাইন সুইচ হিসাবে স্থাপন করা হয়েছিল। এই কনফিগারেশনটি পুরো ক্লাস্টার জুড়ে 2:1 ওভারসাবস্ক্রিপশন সরবরাহ করেছে—তাদের বর্তমান কাজের জন্য পর্যাপ্ত এবং ভবিষ্যতের সম্প্রসারণের জন্য হেডরুম সহ।
| স্থাপনা স্তর | সুইচের সংখ্যা | ব্যবহৃত পোর্ট | সংযোগ |
|---|---|---|---|
| লিফ (প্রতি র্যাক) | 24 | প্রতিটি 32 পোর্ট | টোর সার্ভার + স্পাইন আপলিঙ্ক |
| স্পাইন | 8 | প্রতিটি 36 পোর্ট | সমস্ত লিফ সুইচের সাথে ফুল মেশ |
প্রতিটি লিফ সুইচ NVIDIA ConnectX-6 HDR হোস্ট চ্যানেল অ্যাডাপ্টারের মাধ্যমে কম্পিউট নোডগুলির সাথে সংযোগ স্থাপন করে। MQM8790-HS2F সামঞ্জস্যপূর্ণ অপটিক্স এবং ক্যাবলিং ইকোসিস্টেম টিমকে বিদ্যমান QSFP56 কেবলগুলি পুনরায় ব্যবহার করার অনুমতি দিয়েছে, স্থাপনা ত্বরান্বিত করেছে এবং সংগ্রহ খরচ কমিয়েছে। সম্পূর্ণ ফিজিক্যাল ইনস্টলেশন দুই সপ্তাহের মধ্যে সম্পন্ন হয়েছিল, যেখানে কন্ট্রোল প্লেন স্বয়ংক্রিয় টপোলজি আবিষ্কার এবং প্রভিশনিংয়ের জন্য NVIDIA-এর ইউনিফাইড ফ্যাব্রিক ম্যানেজার (UFM) ব্যবহার করেছে।
সুইচের অ্যাডাপ্টিভ রাউটিং এবং কনজেশন কন্ট্রোল সমর্থন এআই ওয়ার্কলোডের বৈশিষ্ট্যযুক্ত বার্স্টি ট্র্যাফিক পরিচালনা করার জন্য অত্যন্ত গুরুত্বপূর্ণ প্রমাণিত হয়েছে। উপলব্ধ পাথ জুড়ে ডাইনামিকভাবে ফ্লোগুলি পুনরায় বিতরণ করে, MQM8790-HS2F InfiniBand সুইচ হটস্পট গঠন কমিয়েছে এবং পিক জব শিডিউলিং পিরিয়ডগুলিতেও সামঞ্জস্যপূর্ণ পারফরম্যান্স বজায় রেখেছে।
ফলাফল এবং লাভ: জব থ্রুপুট এবং জিপিইউ ইউটিলাইজেশনে পরিমাপযোগ্য উন্নতি
তিন মাস উৎপাদন অপারেশনের পরে, সুপারকম্পিউটিং সেন্টার একাধিক মাত্রায় উল্লেখযোগ্য কর্মক্ষমতা লাভের কথা জানিয়েছে:
- লেটেন্সি হ্রাস:পূর্ববর্তী EDR ফ্যাব্রিকের 680 ns থেকে NVIDIA Mellanox MQM8790-HS2F এর সাথে 130 ns এর নিচে গড় MPI পিং-পং লেটেন্সি কমেছে, যা মেসেজ এক্সচেঞ্জ দক্ষতার 5x উন্নতির প্রতিনিধিত্ব করে।
- কালেক্টিভ অপারেশন স্পিডআপ:SHARP v3.0 অফলোডের কারণে 1024-নোড জবের জন্য অল-রিডিউস লেটেন্সি 62% কমেছে, যা সরাসরি সুইচ ফ্যাব্রিকের মধ্যে রিডাকশন অপারেশন সম্পাদন করে।
- GPU ব্যবহার:কম লেটেন্সি এবং উচ্চতর ব্যান্ডউইথের সম্মিলিত প্রভাব গড় GPU ব্যবহার 72% থেকে 91% এ উন্নীত করেছে, যা বৃহৎ ভাষা মডেল প্রশিক্ষণের জন্য সময়-থেকে-সমাধানে 26% হ্রাস পেয়েছে।
- জব শিডিউলিং দক্ষতা:কম টেইল লেটেন্সি ভ্যারিয়েন্স SLURM শিডিউলারকে পারফরম্যান্স হস্তক্ষেপ ছাড়াই একই নোড সেটে আরও বেশি জব প্যাক করার অনুমতি দিয়েছে, যা সামগ্রিক ক্লাস্টার থ্রুপুট প্রায় 18% বৃদ্ধি করেছে।
যখন টিম পরে অন্যান্য বিক্রেতাদের বিকল্প সুইচগুলির বিরুদ্ধে MQM8790-HS2F মূল্য বেঞ্চমার্ক করেছিল, তখন তারা দেখেছিল যে প্রতি Gb/s এর মোট খরচ অত্যন্ত প্রতিযোগিতামূলক ছিল—বিশেষ করে যখন হ্রাসকৃত ব্যবস্থাপনা ওভারহেড এবং সুইচের HDR এবং HDR100 লিঙ্ক গতি উভয়ই সমর্থন করার ক্ষমতা বিবেচনা করা হয়, যা মিশ্র-গতির পরিবেশে বিনিয়োগ রক্ষা করে।
অপারেশনাল দৃষ্টিকোণ থেকে, সমন্বিত UFM প্ল্যাটফর্ম ফ্যাব্রিক স্বাস্থ্য, ট্র্যাফিক প্যাটার্ন এবং লিঙ্ক-স্তরের ত্রুটিগুলি নিরীক্ষণের জন্য একটি একক প্যান গ্লাস সরবরাহ করেছে। এই দৃশ্যমানতা টিমকে অবনতিশীল কেবলগুলি সক্রিয়ভাবে সনাক্ত করতে এবং নির্ধারিত রক্ষণাবেক্ষণের সময় সেগুলি প্রতিস্থাপন করতে সক্ষম করেছে, অনাকাঙ্ক্ষিত ডাউনটাইম এড়িয়ে।
সারসংক্ষেপ এবং পূর্বাভাস: পরবর্তী প্রজন্মের লো-লেটেন্সি ফ্যাব্রিকের জন্য একটি ব্লুপ্রিন্ট
এই কেস স্টাডিটি প্রদর্শন করে যে MQM8790-HS2F InfiniBand সুইচ সমাধান কেবল একটি সাধারণ গতির আপগ্রেড নয়—এটি তাদের এআই এবং এইচপিসি অবকাঠামোর সম্পূর্ণ কর্মক্ষমতা সম্ভাবনা উন্মোচন করতে চাওয়া সংস্থাগুলির জন্য একটি রূপান্তরমূলক উপাদান। উচ্চ পোর্ট ঘনত্ব, অতি-নিম্ন লেটেন্সি এবং ইন-নেটওয়ার্ক কম্পিউটিং ক্ষমতাগুলির সমন্বয় করে, সুইচটি সরাসরি যোগাযোগ বাধাগুলির সমাধান করে যা ঐতিহাসিকভাবে ক্লাস্টার স্কেলেবিলিটি সীমিত করেছে।
ভবিষ্যতের দিকে তাকিয়ে, সুপারকম্পিউটিং সেন্টার আগামী অর্থবছরে 2,400 নোডে তার ফ্যাব্রিক সম্প্রসারণের পরিকল্পনা করছে, অতিরিক্ত স্পাইন সুইচ সহ একই MQM8790-HS2F আর্কিটেকচার ব্যবহার করে। টিম SHARP v3.0 এর উন্নত রিডাকশন অ্যালগরিদমগুলির জন্য সুইচের সমর্থনও অন্বেষণ করছে, যা গ্রাফ নিউরাল নেটওয়ার্ক এবং রিইনফোর্সমেন্ট লার্নিংয়ের মতো উদীয়মান ওয়ার্কলোডগুলিকে আরও ত্বরান্বিত করার প্রতিশ্রুতি দেয়।
তাদের নিজস্ব ক্লাস্টার বিল্ডগুলির জন্য ইন্টারকানেক্ট বিকল্পগুলি মূল্যায়নকারী আইটি ম্যানেজার, নেটওয়ার্ক আর্কিটেক্ট এবং ইঞ্জিনিয়ারদের জন্য, NVIDIA Mellanox MQM8790-HS2F সাব-মাইক্রোসেকেন্ড লেটেন্সি, সর্বাধিক GPU ব্যবহার এবং সরলীকৃত ফ্যাব্রিক ব্যবস্থাপনা অর্জনের জন্য একটি প্রমাণিত, ফিল্ড-ভ্যালিডেটেড পথ সরবরাহ করে। বিস্তারিত MQM8790-HS2F স্পেসিফিকেশন এবং রেফারেন্স ডিজাইন NVIDIA-এর প্রযুক্তিগত ডকুমেন্টেশন পোর্টাল থেকে উপলব্ধ, এবং সুইচটি এখন ব্যাপকভাবে উপলব্ধ—একটি আঞ্চলিক অংশীদার সনাক্ত করতে বিক্রয়ের জন্য MQM8790-HS2F অনুসন্ধান করুন।

