AI-সহায়তায় QA ও রিলিজ অ্যাসুরেন্স
AI মূল্যায়ন ও টেস্টিং
শুধু চারপাশের অ্যাপ নয়, আপনার প্রোডাক্টের ভেতরের AI-ও টেস্ট করুন। আমরা এজেন্ট, চ্যাটবট ও LLM ফিচারে উত্তরের কোয়ালিটি, গ্রাউন্ডিং, অনুমতি ও ব্যর্থতা সামলানোর মূল্যায়ন করি, এবং রিলিজের স্পষ্ট মানদণ্ড নির্ধারণ করি।

কাদের AI মূল্যায়ন প্রয়োজন
ডেমোতে আপনার AI ফিচারটি ভালোই দেখায়, কিন্তু বাস্তব প্রশ্ন, প্রতিকূল ইনপুট ও অনুপস্থিত ডেটার ক্ষেত্রে এটি কেমন আচরণ করে, অথবা পরের মডেল বা প্রম্পট পরিবর্তনে এটি আরও খারাপ হয়ে যায় কি না, তা এখনো কেউ বলতে পারে না।
- যে টিমগুলো গ্রাহকদের সামনে একটি চ্যাটবট বা অ্যাসিস্ট্যান্ট আনতে যাচ্ছে
- মডেল, প্রোভাইডার বা প্রম্পট বদলাচ্ছেন এমন প্রোডাক্ট ওনার, যাঁদের আগে-পরের তুলনা প্রয়োজন
- যে কোম্পানিগুলো একটি এজেন্টকে অভ্যন্তরীণ রেকর্ড পড়তে বা অন্য সিস্টেমে অ্যাকশন চালু করতে দিচ্ছে
প্রতিটি আচরণ কীভাবে মূল্যায়ন করা হয়
গ্রাহকমুখী একটি অ্যাসিস্ট্যান্টের নমুনা পরিকল্পনা; আপনার ইউজ কেস ও ঝুঁকি অনুযায়ী পদ্ধতি বদলায়।
| অটোমেটেড মূল্যায়ন | বিশেষজ্ঞ রিভিউ | রেড-টিম টেস্টিং | প্রোডাকশনের সংকেত | |
|---|---|---|---|---|
| উত্তরের নির্ভুলতা | প্রধান পদ্ধতি | প্রধান পদ্ধতি | এখানে কদাচিৎ ব্যবহৃত | সহায়ক বা নমুনাভিত্তিক |
| গ্রাউন্ডিং ও সাইটেশন | প্রধান পদ্ধতি | সহায়ক বা নমুনাভিত্তিক | এখানে কদাচিৎ ব্যবহৃত | সহায়ক বা নমুনাভিত্তিক |
| অনুমতির সীমা | সহায়ক বা নমুনাভিত্তিক | প্রধান পদ্ধতি | প্রধান পদ্ধতি | সহায়ক বা নমুনাভিত্তিক |
| প্রম্পট ইনজেকশন | সহায়ক বা নমুনাভিত্তিক | সহায়ক বা নমুনাভিত্তিক | প্রধান পদ্ধতি | সহায়ক বা নমুনাভিত্তিক |
| প্রত্যাখ্যান ও ফলব্যাক | প্রধান পদ্ধতি | সহায়ক বা নমুনাভিত্তিক | সহায়ক বা নমুনাভিত্তিক | প্রধান পদ্ধতি |
- প্রধান পদ্ধতি
- সহায়ক বা নমুনাভিত্তিক
- এখানে কদাচিৎ ব্যবহৃত
AI ফিচার টেস্ট করা একটি ভিন্ন কাজ
একটি চ্যাটবট প্রতিটি ফাংশনাল টেস্টে পাস করেও আত্মবিশ্বাসের সাথে ভুল উত্তর দিতে পারে, এমন ডেটা প্রকাশ করে ফেলতে পারে যা তার করা উচিত নয়, অথবা আপলোড করা কোনো ফাইলে লুকানো নির্দেশনা অনুসরণ করতে পারে। AI ফিচারের প্রয়োজন নিজস্ব মূল্যায়ন: বাস্তব ও কঠিন কেসের ডেটাসেট, উত্তরের কোয়ালিটি ও গ্রাউন্ডিং যাচাই, টুল ও ডেটার অনুমতি, প্রম্পট ইনজেকশনের ঝুঁকি, ব্যর্থতা সামলানো, এবং মডেল বা প্রম্পট বদলালেই রিগ্রেশন চেক। এটি AI-এর সাহায্যে তৈরি একটি সাধারণ অ্যাপ টেস্ট করা থেকে আলাদা, যা সফটওয়্যার QA ও টেস্টিংয়ের আওতায় পড়ে।
বড় পরিসরে গ্রেডিংয়ে AI সাহায্য করে; মানদণ্ড ঠিক করেন বিশেষজ্ঞরা
AI যেভাবে সহায়তা করে
- আপনার অনুমোদিত বাস্তব ব্যবহারকারীর প্রশ্নের বিভিন্ন রূপ তৈরি করে, যার মধ্যে আছে ভিন্নভাবে বলা প্রশ্ন, এজ কেস ও প্রতিকূল (অ্যাডভারসারিয়াল) ইনপুট।
- মডেলভিত্তিক স্কোরিং দিয়ে বিপুল সংখ্যক উত্তর গ্রেড করে, যা বিশেষজ্ঞদের লেবেল করা উত্তরের সাপেক্ষে ক্যালিব্রেট করা।
- ব্যর্থতাগুলোকে কারণ অনুযায়ী গুচ্ছবদ্ধ করে, যেমন অনুপস্থিত কনটেক্সট, ভুল টুল কল বা উপেক্ষিত নির্দেশনা।
- মডেল, প্রম্পট বা রিট্রিভালের পরিবর্তনের আগে-পরের রান তুলনা করে এবং কোথায় আচরণের অবনতি হয়েছে, তা চিহ্নিত করে।
আমাদের বিশেষজ্ঞদের দায়িত্ব
- সঠিক, নিরাপদ ও কার্যকর উত্তর কী, তা বিশেষজ্ঞরা নির্ধারণ করেন, আপনার ডোমেইন বিশেষজ্ঞদের সাথে মিলে।
- মডেলভিত্তিক গ্রেড মানুষ নমুনা ধরে যাচাই করেন, আর যে গ্রেডার বিশেষজ্ঞদের সাথে একমত হয় না, সেটি ঠিক করা হয় বা বাদ দেওয়া হয়।
- একটি এজেন্ট কোন টুল ও ডেটা ব্যবহার করতে পারবে, এবং কোথায় একজন মানুষকে অনুমোদন দিতে বা নিয়ন্ত্রণ নিতে হবে, তা ঠিক করেন মানুষই।
- রিলিজের মানদণ্ড এবং রিলিজ হবে কি না, সেই সিদ্ধান্ত থাকে আপনার ও আমাদের টিমের হাতে, শুধু একটি স্কোরের ওপর নয়।
আপনি কী পাবেন
প্রতিটি পরিবর্তনে আবার চালানো যায় এমন মূল্যায়ন
মূল্যায়ন ডেটাসেট
প্রত্যাশিত আচরণসহ লেবেল করা বাস্তব ও সিন্থেটিক কেস: সাধারণ প্রশ্ন, এজ কেস, স্কোপের বাইরের অনুরোধ ও আগের ব্যর্থতা।
উত্তরের কোয়ালিটি ও গ্রাউন্ডিং
নির্ভুলতা, প্রাসঙ্গিকতা ও টোন, এবং উত্তরগুলো আপনার সোর্স দ্বারা সমর্থিত কি না; সাইটেশন যাচাই করা হয় এবং হ্যালুসিনেশন চিহ্নিত করা হয়।
টুল ও ডেটার অনুমতি টেস্ট
একটি এজেন্ট কী পড়তে, বদলাতে বা চালু করতে পারে, তা টেস্ট করা হয় ন্যূনতম প্রয়োজনীয় অনুমতি, অনুমোদনের ধাপ এবং মানুষের নিয়ন্ত্রণ নেওয়ার পথের সাপেক্ষে।
প্রম্পট ইনজেকশনের ঝুঁকি
মেসেজ, আপলোড করা ফাইল, ওয়েব পেজ ও রিট্রিভ করা ডকুমেন্টের মাধ্যমে সরাসরি ও পরোক্ষ ইনজেকশন, একজন আক্রমণকারী কতদূর পৌঁছাতে পারত, সেই অনুযায়ী মূল্যায়িত।
ব্যর্থতা সামলানো ও ফলব্যাক
মডেল টাইম আউট হলে, কোনো প্রোভাইডার বন্ধ থাকলে, রিট্রিভালে কিছু না পাওয়া গেলে বা কনফিডেন্স কম হলে আচরণ কেমন হয়: ফলব্যাক, স্পষ্ট মেসেজ, মানুষের কাছে হস্তান্তর।
রিগ্রেশন চেক ও রিলিজের মানদণ্ড
মডেল, প্রম্পট বা ডেটা বদলালে আবার চলে এমন অটোমেটেড মূল্যায়ন, সাথে সম্মত মানদণ্ড, যা ঠিক করে কোনো পরিবর্তন শিপ হবে কি না।
একটি AI মূল্যায়ন যেভাবে চলে
- 01
ভালো আচরণ নির্ধারণ
আপনার টিম ও ডোমেইন বিশেষজ্ঞদের সাথে মিলে ইউজ কেস, ঝুঁকি, কোয়ালিটির মানদণ্ড ও অনুমতি ঠিক করা, এবং আপনি ব্যবহারের অনুমতি দেন এমন বাস্তব উদাহরণ সংগ্রহ করা।
- 02
ডেটাসেট তৈরি
কঠিন ও প্রতিকূল কেসসহ মূল্যায়ন কেস একত্র ও লেবেল করা, এবং প্রতিটি পরিবর্তনকে যে রিলিজ মানদণ্ড পূরণ করতে হবে, তা নির্ধারণ করা।
- 03
মূল্যায়ন ও খুঁটিয়ে পরীক্ষা
বিশেষজ্ঞদের রিভিউসহ অটোমেটেড মূল্যায়ন চালানো, অনুমতি ও প্রম্পট ইনজেকশনের রেড-টিম টেস্ট করা, এবং ব্যর্থতার উৎস প্রম্পট, রিট্রিভাল, টুল নাকি মডেল, তা খুঁজে বের করা।
- 04
রিলিজ গেট ও মনিটরিং
আপনার রিলিজ প্রক্রিয়ায় মূল্যায়ন যুক্ত করা, সুপারিশকৃত ফিক্সসহ ফলাফল রিপোর্ট করা, এবং প্রোডাক্ট বদলানোর সাথে সাথে ডেটাসেট হালনাগাদ রাখা।
AI টুল নিয়ে কাজের দুটি উপায়
AI টেস্টের খসড়া তৈরি ও ত্রুটি অনুসন্ধানে সাহায্য করে। এটি আপনার কোড ও টেস্ট ডেটা কোথায় প্রসেস করতে পারবে, তা বেছে নিন।
- প্রাইভেট / লোকাল AI ইঞ্জিনিয়ারিং
আপনার নিয়ন্ত্রণাধীন ইনফ্রাস্ট্রাকচারে বা সম্মত একটি আইসোলেটেড এনভায়রনমেন্টে প্রাইভেটভাবে হোস্ট করা মডেল।
এই প্যাকেজ নিয়ে আলোচনা করুন - Claude Code / OpenAI Codex ইঞ্জিনিয়ারিং
আপনার প্রতিষ্ঠানের অনুমোদিত ক্লাউড সেটিংসে Claude Code এবং/অথবা OpenAI Codex।
এই প্যাকেজ নিয়ে আলোচনা করুন
নিশ্চিত নন? স্কোপিংয়ের সময় আমরা একটি সুপারিশ করব। প্যাকেজ দুটির বিস্তারিত তুলনা দেখুন
সাধারণত যে ধরনের মূল্যায়ন অনুরোধ আসে
যে ধরনের পরিস্থিতি আমরা সাধারণত স্কোপ করি; এগুলো ক্লায়েন্টের কেস স্টাডি নয়।
পাবলিক লঞ্চের আগে হেল্প-সেন্টার অ্যাসিস্ট্যান্ট
একটি টিম এমন একটি অ্যাসিস্ট্যান্ট চায়, যা তাদের হেল্প আর্টিকেল থেকে উত্তর দেবে। আমরা বাস্তব সাপোর্ট প্রশ্নগুলোকে একটি লেবেল করা সেটে রূপ দিই, উত্তর ও সাইটেশন গ্রেড করি, স্কোপের বাইরের ও প্রতিকূল কেস যোগ করি, এবং লঞ্চের আগেই টিমের সাথে মিলে রিলিজের মানদণ্ড ঠিক করি।
একটি ফিচারকে কম খরচের মডেলে সরিয়ে নেওয়া
একজন প্রোডাক্ট ওনার একটি ফিচারকে তুলনামূলক সস্তা কোনো মডেল বা প্রোভাইডারে নিতে চান। আমরা দুটিতেই একই মূল্যায়ন সেট চালাই, কোথায় উত্তর ভালো বা খারাপ হয় এবং লেটেন্সি কীভাবে বদলায়, তা দেখাই, আর সিদ্ধান্ত তাঁর হাতেই ছেড়ে দিই।
যে এজেন্ট রেকর্ড বদলাতে পারে
একটি কোম্পানি একটি অভ্যন্তরীণ এজেন্টকে অর্ডার আপডেট করতে দেয়। আমরা এর টুলের অনুমতি ও অনুমোদনের ধাপগুলোর রেড-টিম টেস্ট করি, পরোক্ষ ইনজেকশন যাচাই করতে এজেন্টটি যে ডকুমেন্টগুলো পড়ে, সেগুলোতে নির্দেশনা গুঁজে দিই, এবং এজেন্ট কোনো পদক্ষেপ নেওয়ার আগে কোথায় একজন মানুষের অনুমোদন বাধ্যতামূলক হওয়া উচিত, তার সুপারিশ করি।
AI মূল্যায়ন কোথায় শেষ হয়
- প্রম্পট, রিট্রিভাল বা মডেল নিজে বদলানো মূল্যায়নের অংশ নয়; আমরা ফিক্সের সুপারিশ করি, আর সেগুলো করে আপনার টিম, অথবা আমরা সেগুলো LLM ইন্টিগ্রেশনের আওতায় স্কোপ করি।
- ফিচারের পেছনের সার্ভার, API ও ক্লাউড অ্যাকাউন্টে আক্রমণ পেনেট্রেশন টেস্টিংয়ের আওতায় পড়ে; এখানে আমরা মডেলের নির্দেশনা, টুল ও ডেটা অ্যাক্সেস খুঁটিয়ে পরীক্ষা করি।
- সর্বোচ্চ ট্রাফিকে লেটেন্সি, রেট লিমিট ও মডেলের খরচ পরিমাপ করা হয় পারফরম্যান্স টেস্টিংয়ে।
- আপনার AI ব্যবহারের আইনি বা নিয়ন্ত্রক অনুমোদন এতে অন্তর্ভুক্ত নয়; ফলাফলগুলো আপনার নিজস্ব ঝুঁকি ও কমপ্লায়েন্স রিভিউয়ের জন্য প্রমাণ হিসেবে কাজ করে।
ডিজাইন, QA ও পরিচালনার সাথে AI মূল্যায়ন যেভাবে যুক্ত
ডিজাইন: ব্যবহারযোগ্য তত্ত্বাবধান
ব্যবহারকারীরা সোর্স, অনিশ্চয়তা ও এরর কীভাবে দেখবেন, এবং আপনার কর্মীরা কীভাবে একটি এজেন্টের কাজ রিভিউ ও সংশোধন করবেন বা তার কাছ থেকে নিয়ন্ত্রণ নেবেন, তা ঠিক করেন ডিজাইনাররা।
QA: প্রোডাক্টের বাকি অংশও
সফটওয়্যার QA কভার করে AI-এর চারপাশের অ্যাপ, যেমন সাইন-ইন, পেমেন্ট, রোল ও ইন্টিগ্রেশন, যা অন্য যেকোনো রিলিজের মতোই রিকোয়ারমেন্টের সাপেক্ষে টেস্ট করা হয়।
পরিচালনা: প্রোডাকশনে কোয়ালিটি
প্রোডাকশন লগ, ব্যবহারকারীর ফিডব্যাক, লেটেন্সি ও খরচ থেকে মনিটরিং ও নতুন মূল্যায়ন কেস তৈরি হয়, আর কোয়ালিটি সরে যেতে শুরু করলে অ্যালার্ট আসে।
চলমান: প্রতিটি পরিবর্তনের পুনর্মূল্যায়ন
মডেল আপগ্রেড, প্রম্পট এডিট ও নতুন ডেটা সোর্স রিলিজের আগে মূল্যায়ন করা হয়, আপনার সাথে সম্মত AI পরিচালনার অংশ হিসেবে।
প্রশ্নোত্তর
সাধারণ প্রশ্নাবলী
AI-এর সাহায্যে তৈরি একটি অ্যাপ টেস্ট করা থেকে এটি কীভাবে আলাদা?
AI কোডিং টুল দিয়ে লেখা অ্যাপও সাধারণ সফটওয়্যারের মতোই আচরণ করে, তাই সেটি সফটওয়্যার QA ও টেস্টিংয়ের আওতায় পড়ে। AI মূল্যায়ন সেইসব প্রোডাক্টের জন্য, যেখানে রানটাইমে একটি মডেল উত্তর তৈরি করে বা কোনো কাজ সম্পাদন করে। আউটপুট বদলায়, তাই আমরা অনেকগুলো কেসজুড়ে কোয়ালিটি পরিমাপ করি, অনুমতি টেস্ট করি এবং ব্যর্থতার জন্য পরিকল্পনা করি। অনেক প্রোডাক্টের দুটোই প্রয়োজন হয়, আর আমরা সেগুলো একসাথে স্কোপ করি।
আপনারা কোন কোন মডেল ও AI স্ট্যাক মূল্যায়ন করতে পারেন?
OpenAI বা Claude-এর মতো হোস্টেড মডেলে তৈরি ফিচার, Llama বা Mistral-এর মতো ওপেন-ওয়েট মডেল, রিট্রিভাল পাইপলাইন ও এজেন্ট ফ্রেমওয়ার্ক। পদ্ধতিটি প্রোভাইডারের ওপর নির্ভর করে না, তাই আপনার নিজস্ব কেসে মডেল বা প্রোভাইডার তুলনা করতেও আপনি এটি ব্যবহার করতে পারেন।
মূল্যায়ন কি AI-এর ভুল করা পুরোপুরি বন্ধ করতে পারে?
না। মডেল তবুও ভুল করতে পারে। মূল্যায়ন দেখায় মডেল কোথায় ও কীভাবে ব্যর্থ হয়, যাতে আপনি রিলিজের মানদণ্ড ঠিক করতে পারেন, গার্ডরেইল ও ফলব্যাক যোগ করতে পারেন, যেখানে ভুলের মূল্য বেশি সেখানে মানুষের রিভিউ ডিজাইন করতে পারেন, এবং কোয়ালিটি বদলালে দ্রুত টের পান।
আমাদের প্রম্পট, লগ ও মূল্যায়ন ডেটা কোথায় প্রসেস করা হয়?
আপনার ফিচারের নিজস্ব মডেল কল যায় সেই প্রোভাইডারের কাছেই, যাকে আপনি ইতিমধ্যে ব্যবহার করছেন। কাজে আমরা যে AI টুল ব্যবহার করি, যেমন মডেলভিত্তিক গ্রেডিং, তা চলে আপনার বেছে নেওয়া সীমানার ভেতরে: প্রাইভেট / লোকাল AI ইঞ্জিনিয়ারিংয়ে আপনার নিয়ন্ত্রণাধীন ইনফ্রাস্ট্রাকচারে, অথবা Claude Code / OpenAI Codex ইঞ্জিনিয়ারিংয়ে সম্মত ডেটা হ্যান্ডলিংয়ের শর্তে। আপনার সাথে সম্মতি অনুযায়ী, লগে থাকা ব্যক্তিগত ডেটা ব্যবহারের আগে মাস্ক করা হয়।
সম্পর্কিত লেখা
- LLM Evals You Can Show a Client
Golden sets, regression dashboards, and how we stop prompt tweaks from silently breaking last month’s wins.
- RAG Pipelines That Do Not Hallucinate Your Docs
Chunking, citations, and evals we use when a client wants an LLM that actually stays on their knowledge base.
- Observability for AI Features in Production
Traces, token budgets, and user-visible fallbacks when the model or the vector store blinks.
শিপ করার আগেই দেখুন আপনার AI কেমন আচরণ করে
আপনার AI ফিচার কী করে, কোন মডেল ব্যবহার করে এবং কোন বিষয়ে আপনি চিন্তিত, আমাদের জানান। আমরা একটি মূল্যায়ন পরিকল্পনা ও রিলিজের মানদণ্ডের পরামর্শ দেব।


