উপযুক্ত সমস্যা: ডেটা সংবেদনশীল শিল্প কেন অবশ্যই ব্যক্তিগত ডেপ্লয়মেন্ট গ্রহণ করবে?
অর্থ, স্বাস্থ্যসেবা, সরকারি প্রশাসন ইত্যাদি ডেটা নিরাপত্তার ক্ষেত্রে কঠোর প্রয়োজনীয়তা সম্পন্ন শিল্পগুলো পাবলিক বৃহৎ মডেলে ডেটা পাঠাতে পারে না। ব্যক্তিগত ডেপ্লয়মেন্ট ডেটাকে অভ্যন্তরীণ নেটওয়ার্কের বাইরে যেতে দেয় না এবং দীর্ঘমেয়াদী ব্যবহারের খরচ ক্লাউড API-এর ১/৫ থেকে ১/৩। IDC তথ্য অনুসারে, ২০২৪ সালে চীনের ইন্টেলিজেন্ট কম্পিউটিং ক্ষমতা ৭২৫.৩ EFLOPS-এ পৌঁছেছে, বছরে ৭৪.১% বৃদ্ধি, কম্পিউটিং সরবরাহের দ্রুত সম্প্রসারণ ব্যক্তিগত ডেপ্লয়মেন্টের প্রান্তিকতা ক্রমাগত কমিয়ে আনছে।
> Gartner-এর '২০২৫ সালের কৃত্রিম বুদ্ধিমত্তা প্রযুক্তি পরিপক্কতা বক্ররেখা' নির্দেশ করে: ৫৭%-এর বেশি প্রতিষ্ঠানের ডেটা এখনো AI প্রস্তুতির মান পূরণ করেনি। ব্যক্তিগত ডেপ্লয়মেন্ট কেবল নিরাপত্তা ও সঙ্গতির প্রয়োজন নয়, বরং প্রতিষ্ঠানের AI দক্ষতা সঞ্চয় ও ডেটা ফ্লাইহুইল নির্মাণের অবকাঠামো।
সমাধানের সারসংক্ষেপ: ব্যক্তিগত ডেপ্লয়মেন্টের মূল সুবিধাসমূহ
প্রযুক্তিগত আর্কিটেকচার: বিভিন্ন আকারের প্রতিষ্ঠানের জন্য ডেপ্লয়মেন্ট সমাধান
লাইটওয়েট সমাধান: 7B প্যারামিটার মডেল, একক কার্ড ডেপ্লয়মেন্ট
ছোট ও মাঝারি প্রতিষ্ঠান বা একক ব্যবসায়িক পরিস্থিতির জন্য উপযুক্ত। 7B প্যারামিটার মডেল INT4 কোয়ান্টাইজেশনের পরে মাত্র ৬-৮GB ভিডিও মেমোরি প্রয়োজন, একটি একক A10/A100 দিয়ে চালানো সম্ভব, ইনফারেন্স গতি ৫০-৮০ টোকেন/সেকেন্ড। প্রাথমিক হার্ডওয়্যার বিনিয়োগ ১-২ লক্ষ RMB (সার্ভার সহ), মাসিক অপারেশন ও রক্ষণাবেক্ষণ খরচ ৫,০০০ RMB-এর কম।
স্ট্যান্ডার্ড সমাধান: 14B-34B প্যারামিটার মডেল, ডুয়াল/কোয়াড কার্ড ডেপ্লয়মেন্ট
মাঝারি আকারের প্রতিষ্ঠানের বহুবিধ পরিস্থিতির জন্য উপযুক্ত। ২-৪টি A100 কার্ড দিয়ে এন্টারপ্রাইজ-লেভেল ইনফারেন্স পরিষেবা প্রদান করা যায়, ১০০+ ব্যবহারকারীর কনকারেন্সি সমর্থন করে। সাধারণ ডেপ্লয়মেন্ট খরচ ৪০-৮০ লক্ষ RMB, ৬-১২ মাসের মধ্যে API কল খরচ সাশ্রয়ের মাধ্যমে বিনিয়োগ পুনরুদ্ধার সম্ভব।
এন্টারপ্রাইজ সমাধান: 70B+ প্যারামিটার মডেল, ইনফারেন্স ক্লাস্টার ডেপ্লয়মেন্ট
বৃহৎ প্রতিষ্ঠানের মূল ব্যবসায়িক পরিস্থিতির জন্য উপযুক্ত। ৪-৮টি A100/H800 কার্ড দিয়ে ইনফারেন্স ক্লাস্টার গঠন করা হয়, উচ্চ কনকারেন্সি ও কম ল্যাটেন্সির পরিস্থিতি সমর্থন করে। হাইব্রিড ক্লাউড আর্কিটেকচারের সাথে সামঞ্জস্য রেখে মূল ডেটা স্থানীয়ভাবে প্রক্রিয়া করা হয়, সাধারণ পরিস্থিতিতে ক্লাউড বৃহৎ মডেল কল করা হয়, সামগ্রিক খরচ সর্বোত্তম।
পরিমাণগত সুবিধা
| সমাধান স্তর | হার্ডওয়্যার বিনিয়োগ | ইনফারেন্স পারফরম্যান্স | উপযুক্ত পরিস্থিতি |
|---|---|---|---|
| লাইটওয়েট | ১০-২০ লক্ষ RMB | ৫০-৮০ টোকেন/সেকেন্ড | একক ব্যবসায়িক পরিস্থিতি |
| স্ট্যান্ডার্ড | ৪০-৮০ লক্ষ RMB | ১০০+ কনকারেন্ট ব্যবহারকারী | বহুবিধ পরিস্থিতি |
| এন্টারপ্রাইজ | ১০০ লক্ষ+ RMB | উচ্চ কনকারেন্সি, কম ল্যাটেন্সি | মূল ব্যবসা + হাইব্রিড ক্লাউড |
দীর্ঘমেয়াদী ব্যবহারের খরচ ক্লাউড API-এর ১/৫ থেকে ১/৩, ৬-১২ মাসের মধ্যে API কল খরচ সাশ্রয়ের মাধ্যমে বিনিয়োগ পুনরুদ্ধার সম্ভব।
উপযুক্ত সীমাবদ্ধতা
উপযুক্ত: অর্থ, স্বাস্থ্যসেবা, সরকারি প্রশাসন ইত্যাদি ডেটা সংবেদনশীল শিল্প; বার্ষিক API কল খরচ ২০ লক্ষ RMB-এর বেশি প্রতিষ্ঠান; ডেটা সঙ্গতির (তথ্য সুরক্ষা গ্রেড 2.0/3.0) কঠোর প্রয়োজনীয়তা রয়েছে এমন প্রতিষ্ঠান।
উপযুক্ত নয়: ডেটা সঙ্গতির প্রয়োজনীয়তা বেশি নয়, AI ব্যবহারের ফ্রিকোয়েন্সি কম (মাসিক কল <১০,০০০ বার) এমন প্রতিষ্ঠান — সরাসরি ক্লাউড API ব্যবহার অধিক সাশ্রয়ী।
সাধারণ প্রশ্নাবলী
বৃহৎ মডেলের ব্যক্তিগত ডেপ্লয়মেন্টের জন্য কত GPU কম্পিউটিং ইনপুট প্রয়োজন?
7B প্যারামিটার মডেল (যেমন Qwen2-7B) একক কার্ড A10/A100 দিয়ে ডেপ্লয়মেন্ট সম্ভব, 70B প্যারামিটার মডেলের জন্য ৪×A100 ক্লাস্টার সুপারিশ করা হয়। IDC রিপোর্ট অনুযায়ী, ২০২৪ সালে চীনের ইন্টেলিজেন্ট কম্পিউটিং ক্ষমতা ৭২৫.৩ EFLOPS-এ পৌঁছেছে, যা বার্ষিক ৭৪.১% বৃদ্ধি; কম্পিউটিং সাপ্লাই দ্রুত সম্প্রসারিত হওয়ায় ডেপ্লয়মেন্ট খরচ বছরে ৩০%-এর বেশি হ্রাস পাচ্ছে। প্রতিষ্ঠান ব্যবসায়িক পরিমাণ অনুযায়ী চাহিদামাফিক সম্প্রসারণ বেছে নিতে পারে, প্রাথমিক বিনিয়োগ ১ লক্ষ RMB-এর মধ্যে নিয়ন্ত্রণ করা সম্ভব।
ব্যক্তিগত ডেপ্লয়মেন্টে বৃহৎ মডেলের পারফরম্যান্স কি পাবলিক ক্লাউড API-এর কাছাকাছি হতে পারে?
হ্যাঁ। INT4/INT8 কোয়ান্টাইজেশন এবং vLLM ইনফারেন্স অ্যাক্সিলারেশনের মাধ্যমে, 7B মডেল একক কার্ডে ৫০-৮০ টোকেন/সেকেন্ড ইনফারেন্স গতি অর্জন করতে পারে, যা কিছু পাবলিক ক্লাউড API-এর রেসপন্স গতির কাছাকাছি বা অতিক্রম করে। মূল সুবিধা হলো ডেটা শূন্য বহির্গমন, কম ল্যাটেন্সি (অভ্যন্তরীণ নেটওয়ার্ক সরাসরি <১০ms), কোনো API কল চার্জ নেই, দীর্ঘমেয়াদী ব্যবহারের খরচ ক্লাউড API-এর ১/৫ থেকে ১/৩।
ব্যক্তিগত ডেপ্লয়মেন্টের পর কীভাবে মডেল আপগ্রেড ও রক্ষণাবেক্ষণ করা হয়?
আমরা সম্পূর্ণ মডেল ভার্সন ম্যানেজমেন্ট এবং গ্রেস্কেল রিলিজ মেকানিজম প্রদান করি: নতুন মডেল প্রথমে ছোট ট্রাফিক পরিবেশে যাচাই করা হয়, স্থিতিশীলতা নিশ্চিত হওয়ার পর ধীরে ধীরে পরিমাণ বাড়ানো হয়। পাশাপাশি, একটানা মনিটরিং ড্যাশবোর্ড সরবরাহ করা হয়, যা রিয়েল-টাইমে ইনফারেন্স ল্যাটেন্সি, থ্রুপুট এবং অস্বাভাবিকতার হার ট্র্যাক করে, পারফরম্যান্স ডিগ্রেডেশন হলে স্বয়ংক্রিয়ভাবে পূর্ববর্তী স্থিতিশীল ভার্সনে রোলব্যাক করে।