चुनौती
एक AI स्टार्टअप जो LLM-संचालित उत्पाद बना रहा था, उसे उत्पादन-ग्रेड अनुमान (inference) के बुनियादी ढांचे की आवश्यकता थी - तेज़ी से। टीम को लंबे GPU लीड टाइम, एक तंग बजट और इन-हाउस डेटा सेंटर का कोई अनुभव नहीं था। उन्हें एक ऐसे आपूर्तिकर्ता की आवश्यकता थी जो एक तैयार क्लस्टर को कॉन्फ़िगर, परीक्षण और वितरित कर सके।
समाधान
हमारे इंजीनियरों के साथ काम करते हुए, ग्राहक ने अपने अनुमान (inference) वर्कलोड के लिए कॉन्फ़िगर किए गए Dell GPU सर्वर चुने:
- उच्च-कोर-गणना विकल्पों के साथ Intel Xeon स्केलेबल प्रोसेसर
- प्रति नोड कई NVIDIA-क्लास GPU, बजट के अनुसार आकार
- उच्च-आवृत्ति DDR5 मेमोरी और NVMe स्टोरेज
- हमारी लैब से प्री-इंस्टॉल OS और मान्य ड्राइवर
प्रत्येक नोड को शिपमेंट से पहले बर्न-इन और स्ट्रेस-टेस्ट किया गया था, और हमने एक चरणबद्ध डिलीवरी योजना प्रदान की ताकि टीम बाकी के आने के दौरान पहले नोड्स के साथ परीक्षण शुरू कर सके।
परिणाम
- क्लस्टर 7 सप्ताह में तैनात किया गया, जबकि कहीं और 2 महीने का लीड टाइम बताया गया था
- पिछले सिंगल-GPU सेटअप की तुलना में अनुमान (inference) विलंबता (latency) में 10% की कमी आई
- 24 महीनों में समतुल्य क्लाउड GPU इंस्टेंस को लीज पर लेने की तुलना में 10% लागत बचत
मुख्य सीख
पहले क्लस्टर को सही आकार देना सबसे बड़े को खरीदने से ज़्यादा मायने रखता है। परीक्षण किए गए, फ़ैक्टरी-डायरेक्ट हार्डवेयर से शुरुआत करना और मांग बढ़ने के साथ स्केल करना इस स्टार्टअप को पूंजी को अधिक प्रतिबद्ध किए बिना लाइव होने की अनुमति देता है।
अपने AI अनुमान (inference) या प्रशिक्षण बुनियादी ढांचे की योजना बनाने के लिए हमसे संपर्क करें।