AI-সহায়তায় QA ও রিলিজ অ্যাসুরেন্স

AI মূল্যায়ন ও টেস্টিং

শুধু চারপাশের অ্যাপ নয়, আপনার প্রোডাক্টের ভেতরের AI-ও টেস্ট করুন। আমরা এজেন্ট, চ্যাটবট ও LLM ফিচারে উত্তরের কোয়ালিটি, গ্রাউন্ডিং, অনুমতি ও ব্যর্থতা সামলানোর মূল্যায়ন করি, এবং রিলিজের স্পষ্ট মানদণ্ড নির্ধারণ করি।

কাদের AI মূল্যায়ন প্রয়োজন

ডেমোতে আপনার AI ফিচারটি ভালোই দেখায়, কিন্তু বাস্তব প্রশ্ন, প্রতিকূল ইনপুট ও অনুপস্থিত ডেটার ক্ষেত্রে এটি কেমন আচরণ করে, অথবা পরের মডেল বা প্রম্পট পরিবর্তনে এটি আরও খারাপ হয়ে যায় কি না, তা এখনো কেউ বলতে পারে না।

  • যে টিমগুলো গ্রাহকদের সামনে একটি চ্যাটবট বা অ্যাসিস্ট্যান্ট আনতে যাচ্ছে
  • মডেল, প্রোভাইডার বা প্রম্পট বদলাচ্ছেন এমন প্রোডাক্ট ওনার, যাঁদের আগে-পরের তুলনা প্রয়োজন
  • যে কোম্পানিগুলো একটি এজেন্টকে অভ্যন্তরীণ রেকর্ড পড়তে বা অন্য সিস্টেমে অ্যাকশন চালু করতে দিচ্ছে

প্রতিটি আচরণ কীভাবে মূল্যায়ন করা হয়

গ্রাহকমুখী একটি অ্যাসিস্ট্যান্টের নমুনা পরিকল্পনা; আপনার ইউজ কেস ও ঝুঁকি অনুযায়ী পদ্ধতি বদলায়।

অটোমেটেড মূল্যায়নবিশেষজ্ঞ রিভিউরেড-টিম টেস্টিংপ্রোডাকশনের সংকেত
উত্তরের নির্ভুলতাপ্রধান পদ্ধতিপ্রধান পদ্ধতিএখানে কদাচিৎ ব্যবহৃতসহায়ক বা নমুনাভিত্তিক
গ্রাউন্ডিং ও সাইটেশনপ্রধান পদ্ধতিসহায়ক বা নমুনাভিত্তিকএখানে কদাচিৎ ব্যবহৃতসহায়ক বা নমুনাভিত্তিক
অনুমতির সীমাসহায়ক বা নমুনাভিত্তিকপ্রধান পদ্ধতিপ্রধান পদ্ধতিসহায়ক বা নমুনাভিত্তিক
প্রম্পট ইনজেকশনসহায়ক বা নমুনাভিত্তিকসহায়ক বা নমুনাভিত্তিকপ্রধান পদ্ধতিসহায়ক বা নমুনাভিত্তিক
প্রত্যাখ্যান ও ফলব্যাকপ্রধান পদ্ধতিসহায়ক বা নমুনাভিত্তিকসহায়ক বা নমুনাভিত্তিকপ্রধান পদ্ধতি
  • প্রধান পদ্ধতি
  • সহায়ক বা নমুনাভিত্তিক
  • এখানে কদাচিৎ ব্যবহৃত

AI ফিচার টেস্ট করা একটি ভিন্ন কাজ

একটি চ্যাটবট প্রতিটি ফাংশনাল টেস্টে পাস করেও আত্মবিশ্বাসের সাথে ভুল উত্তর দিতে পারে, এমন ডেটা প্রকাশ করে ফেলতে পারে যা তার করা উচিত নয়, অথবা আপলোড করা কোনো ফাইলে লুকানো নির্দেশনা অনুসরণ করতে পারে। AI ফিচারের প্রয়োজন নিজস্ব মূল্যায়ন: বাস্তব ও কঠিন কেসের ডেটাসেট, উত্তরের কোয়ালিটি ও গ্রাউন্ডিং যাচাই, টুল ও ডেটার অনুমতি, প্রম্পট ইনজেকশনের ঝুঁকি, ব্যর্থতা সামলানো, এবং মডেল বা প্রম্পট বদলালেই রিগ্রেশন চেক। এটি AI-এর সাহায্যে তৈরি একটি সাধারণ অ্যাপ টেস্ট করা থেকে আলাদা, যা সফটওয়্যার QA ও টেস্টিংয়ের আওতায় পড়ে।

বড় পরিসরে গ্রেডিংয়ে AI সাহায্য করে; মানদণ্ড ঠিক করেন বিশেষজ্ঞরা

AI যেভাবে সহায়তা করে

  • আপনার অনুমোদিত বাস্তব ব্যবহারকারীর প্রশ্নের বিভিন্ন রূপ তৈরি করে, যার মধ্যে আছে ভিন্নভাবে বলা প্রশ্ন, এজ কেস ও প্রতিকূল (অ্যাডভারসারিয়াল) ইনপুট।
  • মডেলভিত্তিক স্কোরিং দিয়ে বিপুল সংখ্যক উত্তর গ্রেড করে, যা বিশেষজ্ঞদের লেবেল করা উত্তরের সাপেক্ষে ক্যালিব্রেট করা।
  • ব্যর্থতাগুলোকে কারণ অনুযায়ী গুচ্ছবদ্ধ করে, যেমন অনুপস্থিত কনটেক্সট, ভুল টুল কল বা উপেক্ষিত নির্দেশনা।
  • মডেল, প্রম্পট বা রিট্রিভালের পরিবর্তনের আগে-পরের রান তুলনা করে এবং কোথায় আচরণের অবনতি হয়েছে, তা চিহ্নিত করে।

আমাদের বিশেষজ্ঞদের দায়িত্ব

  • সঠিক, নিরাপদ ও কার্যকর উত্তর কী, তা বিশেষজ্ঞরা নির্ধারণ করেন, আপনার ডোমেইন বিশেষজ্ঞদের সাথে মিলে।
  • মডেলভিত্তিক গ্রেড মানুষ নমুনা ধরে যাচাই করেন, আর যে গ্রেডার বিশেষজ্ঞদের সাথে একমত হয় না, সেটি ঠিক করা হয় বা বাদ দেওয়া হয়।
  • একটি এজেন্ট কোন টুল ও ডেটা ব্যবহার করতে পারবে, এবং কোথায় একজন মানুষকে অনুমোদন দিতে বা নিয়ন্ত্রণ নিতে হবে, তা ঠিক করেন মানুষই।
  • রিলিজের মানদণ্ড এবং রিলিজ হবে কি না, সেই সিদ্ধান্ত থাকে আপনার ও আমাদের টিমের হাতে, শুধু একটি স্কোরের ওপর নয়।

আপনি কী পাবেন

প্রতিটি পরিবর্তনে আবার চালানো যায় এমন মূল্যায়ন

  • মূল্যায়ন ডেটাসেট

    প্রত্যাশিত আচরণসহ লেবেল করা বাস্তব ও সিন্থেটিক কেস: সাধারণ প্রশ্ন, এজ কেস, স্কোপের বাইরের অনুরোধ ও আগের ব্যর্থতা।

  • উত্তরের কোয়ালিটি ও গ্রাউন্ডিং

    নির্ভুলতা, প্রাসঙ্গিকতা ও টোন, এবং উত্তরগুলো আপনার সোর্স দ্বারা সমর্থিত কি না; সাইটেশন যাচাই করা হয় এবং হ্যালুসিনেশন চিহ্নিত করা হয়।

  • টুল ও ডেটার অনুমতি টেস্ট

    একটি এজেন্ট কী পড়তে, বদলাতে বা চালু করতে পারে, তা টেস্ট করা হয় ন্যূনতম প্রয়োজনীয় অনুমতি, অনুমোদনের ধাপ এবং মানুষের নিয়ন্ত্রণ নেওয়ার পথের সাপেক্ষে।

  • প্রম্পট ইনজেকশনের ঝুঁকি

    মেসেজ, আপলোড করা ফাইল, ওয়েব পেজ ও রিট্রিভ করা ডকুমেন্টের মাধ্যমে সরাসরি ও পরোক্ষ ইনজেকশন, একজন আক্রমণকারী কতদূর পৌঁছাতে পারত, সেই অনুযায়ী মূল্যায়িত।

  • ব্যর্থতা সামলানো ও ফলব্যাক

    মডেল টাইম আউট হলে, কোনো প্রোভাইডার বন্ধ থাকলে, রিট্রিভালে কিছু না পাওয়া গেলে বা কনফিডেন্স কম হলে আচরণ কেমন হয়: ফলব্যাক, স্পষ্ট মেসেজ, মানুষের কাছে হস্তান্তর।

  • রিগ্রেশন চেক ও রিলিজের মানদণ্ড

    মডেল, প্রম্পট বা ডেটা বদলালে আবার চলে এমন অটোমেটেড মূল্যায়ন, সাথে সম্মত মানদণ্ড, যা ঠিক করে কোনো পরিবর্তন শিপ হবে কি না।

একটি AI মূল্যায়ন যেভাবে চলে

  1. 01

    ভালো আচরণ নির্ধারণ

    আপনার টিম ও ডোমেইন বিশেষজ্ঞদের সাথে মিলে ইউজ কেস, ঝুঁকি, কোয়ালিটির মানদণ্ড ও অনুমতি ঠিক করা, এবং আপনি ব্যবহারের অনুমতি দেন এমন বাস্তব উদাহরণ সংগ্রহ করা।

  2. 02

    ডেটাসেট তৈরি

    কঠিন ও প্রতিকূল কেসসহ মূল্যায়ন কেস একত্র ও লেবেল করা, এবং প্রতিটি পরিবর্তনকে যে রিলিজ মানদণ্ড পূরণ করতে হবে, তা নির্ধারণ করা।

  3. 03

    মূল্যায়ন ও খুঁটিয়ে পরীক্ষা

    বিশেষজ্ঞদের রিভিউসহ অটোমেটেড মূল্যায়ন চালানো, অনুমতি ও প্রম্পট ইনজেকশনের রেড-টিম টেস্ট করা, এবং ব্যর্থতার উৎস প্রম্পট, রিট্রিভাল, টুল নাকি মডেল, তা খুঁজে বের করা।

  4. 04

    রিলিজ গেট ও মনিটরিং

    আপনার রিলিজ প্রক্রিয়ায় মূল্যায়ন যুক্ত করা, সুপারিশকৃত ফিক্সসহ ফলাফল রিপোর্ট করা, এবং প্রোডাক্ট বদলানোর সাথে সাথে ডেটাসেট হালনাগাদ রাখা।

AI টুল নিয়ে কাজের দুটি উপায়

AI টেস্টের খসড়া তৈরি ও ত্রুটি অনুসন্ধানে সাহায্য করে। এটি আপনার কোড ও টেস্ট ডেটা কোথায় প্রসেস করতে পারবে, তা বেছে নিন।

নিশ্চিত নন? স্কোপিংয়ের সময় আমরা একটি সুপারিশ করব। প্যাকেজ দুটির বিস্তারিত তুলনা দেখুন

সাধারণত যে ধরনের মূল্যায়ন অনুরোধ আসে

যে ধরনের পরিস্থিতি আমরা সাধারণত স্কোপ করি; এগুলো ক্লায়েন্টের কেস স্টাডি নয়।

  • পাবলিক লঞ্চের আগে হেল্প-সেন্টার অ্যাসিস্ট্যান্ট

    একটি টিম এমন একটি অ্যাসিস্ট্যান্ট চায়, যা তাদের হেল্প আর্টিকেল থেকে উত্তর দেবে। আমরা বাস্তব সাপোর্ট প্রশ্নগুলোকে একটি লেবেল করা সেটে রূপ দিই, উত্তর ও সাইটেশন গ্রেড করি, স্কোপের বাইরের ও প্রতিকূল কেস যোগ করি, এবং লঞ্চের আগেই টিমের সাথে মিলে রিলিজের মানদণ্ড ঠিক করি।

  • একটি ফিচারকে কম খরচের মডেলে সরিয়ে নেওয়া

    একজন প্রোডাক্ট ওনার একটি ফিচারকে তুলনামূলক সস্তা কোনো মডেল বা প্রোভাইডারে নিতে চান। আমরা দুটিতেই একই মূল্যায়ন সেট চালাই, কোথায় উত্তর ভালো বা খারাপ হয় এবং লেটেন্সি কীভাবে বদলায়, তা দেখাই, আর সিদ্ধান্ত তাঁর হাতেই ছেড়ে দিই।

  • যে এজেন্ট রেকর্ড বদলাতে পারে

    একটি কোম্পানি একটি অভ্যন্তরীণ এজেন্টকে অর্ডার আপডেট করতে দেয়। আমরা এর টুলের অনুমতি ও অনুমোদনের ধাপগুলোর রেড-টিম টেস্ট করি, পরোক্ষ ইনজেকশন যাচাই করতে এজেন্টটি যে ডকুমেন্টগুলো পড়ে, সেগুলোতে নির্দেশনা গুঁজে দিই, এবং এজেন্ট কোনো পদক্ষেপ নেওয়ার আগে কোথায় একজন মানুষের অনুমোদন বাধ্যতামূলক হওয়া উচিত, তার সুপারিশ করি।

AI মূল্যায়ন কোথায় শেষ হয়

  • প্রম্পট, রিট্রিভাল বা মডেল নিজে বদলানো মূল্যায়নের অংশ নয়; আমরা ফিক্সের সুপারিশ করি, আর সেগুলো করে আপনার টিম, অথবা আমরা সেগুলো LLM ইন্টিগ্রেশনের আওতায় স্কোপ করি।
  • ফিচারের পেছনের সার্ভার, API ও ক্লাউড অ্যাকাউন্টে আক্রমণ পেনেট্রেশন টেস্টিংয়ের আওতায় পড়ে; এখানে আমরা মডেলের নির্দেশনা, টুল ও ডেটা অ্যাক্সেস খুঁটিয়ে পরীক্ষা করি।
  • সর্বোচ্চ ট্রাফিকে লেটেন্সি, রেট লিমিট ও মডেলের খরচ পরিমাপ করা হয় পারফরম্যান্স টেস্টিংয়ে।
  • আপনার AI ব্যবহারের আইনি বা নিয়ন্ত্রক অনুমোদন এতে অন্তর্ভুক্ত নয়; ফলাফলগুলো আপনার নিজস্ব ঝুঁকি ও কমপ্লায়েন্স রিভিউয়ের জন্য প্রমাণ হিসেবে কাজ করে।

ডিজাইন, QA ও পরিচালনার সাথে AI মূল্যায়ন যেভাবে যুক্ত

  • ডিজাইন: ব্যবহারযোগ্য তত্ত্বাবধান

    ব্যবহারকারীরা সোর্স, অনিশ্চয়তা ও এরর কীভাবে দেখবেন, এবং আপনার কর্মীরা কীভাবে একটি এজেন্টের কাজ রিভিউ ও সংশোধন করবেন বা তার কাছ থেকে নিয়ন্ত্রণ নেবেন, তা ঠিক করেন ডিজাইনাররা।

  • QA: প্রোডাক্টের বাকি অংশও

    সফটওয়্যার QA কভার করে AI-এর চারপাশের অ্যাপ, যেমন সাইন-ইন, পেমেন্ট, রোল ও ইন্টিগ্রেশন, যা অন্য যেকোনো রিলিজের মতোই রিকোয়ারমেন্টের সাপেক্ষে টেস্ট করা হয়।

  • পরিচালনা: প্রোডাকশনে কোয়ালিটি

    প্রোডাকশন লগ, ব্যবহারকারীর ফিডব্যাক, লেটেন্সি ও খরচ থেকে মনিটরিং ও নতুন মূল্যায়ন কেস তৈরি হয়, আর কোয়ালিটি সরে যেতে শুরু করলে অ্যালার্ট আসে।

  • চলমান: প্রতিটি পরিবর্তনের পুনর্মূল্যায়ন

    মডেল আপগ্রেড, প্রম্পট এডিট ও নতুন ডেটা সোর্স রিলিজের আগে মূল্যায়ন করা হয়, আপনার সাথে সম্মত AI পরিচালনার অংশ হিসেবে।

প্রশ্নোত্তর

সাধারণ প্রশ্নাবলী

AI-এর সাহায্যে তৈরি একটি অ্যাপ টেস্ট করা থেকে এটি কীভাবে আলাদা?

AI কোডিং টুল দিয়ে লেখা অ্যাপও সাধারণ সফটওয়্যারের মতোই আচরণ করে, তাই সেটি সফটওয়্যার QA ও টেস্টিংয়ের আওতায় পড়ে। AI মূল্যায়ন সেইসব প্রোডাক্টের জন্য, যেখানে রানটাইমে একটি মডেল উত্তর তৈরি করে বা কোনো কাজ সম্পাদন করে। আউটপুট বদলায়, তাই আমরা অনেকগুলো কেসজুড়ে কোয়ালিটি পরিমাপ করি, অনুমতি টেস্ট করি এবং ব্যর্থতার জন্য পরিকল্পনা করি। অনেক প্রোডাক্টের দুটোই প্রয়োজন হয়, আর আমরা সেগুলো একসাথে স্কোপ করি।

আপনারা কোন কোন মডেল ও AI স্ট্যাক মূল্যায়ন করতে পারেন?

OpenAI বা Claude-এর মতো হোস্টেড মডেলে তৈরি ফিচার, Llama বা Mistral-এর মতো ওপেন-ওয়েট মডেল, রিট্রিভাল পাইপলাইন ও এজেন্ট ফ্রেমওয়ার্ক। পদ্ধতিটি প্রোভাইডারের ওপর নির্ভর করে না, তাই আপনার নিজস্ব কেসে মডেল বা প্রোভাইডার তুলনা করতেও আপনি এটি ব্যবহার করতে পারেন।

মূল্যায়ন কি AI-এর ভুল করা পুরোপুরি বন্ধ করতে পারে?

না। মডেল তবুও ভুল করতে পারে। মূল্যায়ন দেখায় মডেল কোথায় ও কীভাবে ব্যর্থ হয়, যাতে আপনি রিলিজের মানদণ্ড ঠিক করতে পারেন, গার্ডরেইল ও ফলব্যাক যোগ করতে পারেন, যেখানে ভুলের মূল্য বেশি সেখানে মানুষের রিভিউ ডিজাইন করতে পারেন, এবং কোয়ালিটি বদলালে দ্রুত টের পান।

আমাদের প্রম্পট, লগ ও মূল্যায়ন ডেটা কোথায় প্রসেস করা হয়?

আপনার ফিচারের নিজস্ব মডেল কল যায় সেই প্রোভাইডারের কাছেই, যাকে আপনি ইতিমধ্যে ব্যবহার করছেন। কাজে আমরা যে AI টুল ব্যবহার করি, যেমন মডেলভিত্তিক গ্রেডিং, তা চলে আপনার বেছে নেওয়া সীমানার ভেতরে: প্রাইভেট / লোকাল AI ইঞ্জিনিয়ারিংয়ে আপনার নিয়ন্ত্রণাধীন ইনফ্রাস্ট্রাকচারে, অথবা Claude Code / OpenAI Codex ইঞ্জিনিয়ারিংয়ে সম্মত ডেটা হ্যান্ডলিংয়ের শর্তে। আপনার সাথে সম্মতি অনুযায়ী, লগে থাকা ব্যক্তিগত ডেটা ব্যবহারের আগে মাস্ক করা হয়।

সম্পর্কিত লেখা

শিপ করার আগেই দেখুন আপনার AI কেমন আচরণ করে

আপনার AI ফিচার কী করে, কোন মডেল ব্যবহার করে এবং কোন বিষয়ে আপনি চিন্তিত, আমাদের জানান। আমরা একটি মূল্যায়ন পরিকল্পনা ও রিলিজের মানদণ্ডের পরামর্শ দেব।