আমাদের মানবিক সহকারী খাতের প্রামাণিক ক্যানন — স্ফিয়ার হ্যান্ডবুক, জেনেভা কনভেনশন, 1951 সালের শরণার্থী কনভেনশন এবং তাদের সমগোত্রীয় দলিলসমূহ — সম্পর্কে প্রশ্নের উত্তর দেয়। এই উত্তরগুলো আমরা নিজেই সংগ্রহ ও এমবেড করা একটি কর্পাস থেকে তৈরি করি, যা একটি ইগ্রেস বাউন্ডারির পেছনে অবস্থিত যেখানে প্রতিটি মডেল কল লগ করা হয়, রেডাক্ট করা হয় এবং তার উৎস শনাক্তযোগ্য থাকে। কর্পাসটি ইংরেজিতে। কিন্তু যাদের এর প্রয়োজন, তারা প্রায়শই ইংরেজিভাষী নন।
তাই আমরা তিনটি ভাষা যুক্ত করার সিদ্ধান্ত নিয়েছি: বাংলা, সোয়াহিলি এবং হাউসা। একসাথে এগুলো কক্সবাজার থেকে সাহেল পর্যন্ত মানবিক প্রেক্ষাপটগুলো কভার করে। আলাদাভাবে বিবেচনা করলে, এগুলো তিনটি খুব ভিন্ন ধরনের ইঞ্জিনিয়ারিং সমস্যা — যা আমরা কেবল তাই জানি কারণ কিছু তৈরি করার আগেই আমরা প্রতিটির পরিমাপ করেছিলাম।
এই পরিমাপগুলোরই গল্প এটি: এগুলোর খরচ কত ছিল (একক অঙ্কের ইউরো), এগুলো কী খুঁজে পেয়েছে, এবং সেই কর্মপদ্ধতি যা স্থাপত্যটিকে কোনো পূর্বধারণার পরিবর্তে সরাসরি ডেটা থেকে উদ্ভূত হতে সাহায্য করেছে।
চারটি স্তর, ব্যর্থ হওয়ার চারটি উপায়
কোনো মডেল কার্ডে আছে বলেই কোনো ভাষা "সাপোর্টেড" হয়ে যায় না। একজন বাংলাভাষী ব্যবহারকারীর জন্য চারটি স্বতন্ত্র স্তরকে কাজ করতে হয়:
- শনাক্তকরণ (Detect) — বার্তাটি কোন ভাষায় লেখা তা জানা। ইউক্রেনীয়/রুশ/ইংরেজি বিশ্বের জন্য তৈরি আমাদের বিদ্যমান হিউরিস্টিক নতুন তিনটি ভাষাকেই ইংরেজি হিসেবে শ্রেণীবদ্ধ করেছিল।
- উদ্ধার (Retrieve) — অন্য ভাষায় লেখা কুয়েরি থেকে সঠিক ইংরেজি অংশগুলো খুঁজে বের করা। ক্রস-লিঙ্গুয়াল রিট্রিভাল হলো এমবেডিং মডেলের কাজ।
- তৈরি (Generate) — ইংরেজি প্রমাণের ওপর ভিত্তি করে ব্যবহারকারীর ভাষায় উত্তর দেওয়া, এমন কোনো প্রোভাইডারের সাহায্য না নিয়ে যা সার্বভৌমিকতার অবস্থানকে লঙ্ঘন করে।
- রেডাকশন (Redact) — কোনো কিছু সীমানা অতিক্রম করার আগে নাম, ফোন নম্বর এবং জাতীয় পরিচয়পত্র শনাক্ত করা। প্রতিটি ভাষার জন্য 'ফেইল ক্লোজড' নীতি মেনে চলা।
প্রতিটি স্তর স্বতন্ত্রভাবে ব্যর্থ হতে পারে, কিন্তু ঘটনা হলো এগুলো প্রতিটি ভাষার জন্য ভিন্নভাবে ব্যর্থ হয়।
প্রথমে পরিমাপ করুন, কিছুই ভাড়া নেবেন না
কোনো স্থাপত্য (বা কোনো GPU) বেছে নেওয়ার আগে, আমরা একটি সার্ভারলেস, প্রতি-টোকেন EU ইনফারেন্স টিয়ারে দুটি প্রোব চালিয়েছিলাম। প্রায় 2,900টি মডেল কল, খরচ পাঁচ ইউরোরও কম, এবং কোনো ইনস্ট্যান্স কখনো প্রভিশন করা হয়নি।
প্রোবগুলো সেই মূল্যায়ন শৃঙ্খলা উত্তরাধিকার সূত্রে পেয়েছিল যা আমরা ইংরেজি স্ট্যাকের ক্ষেত্রে ইতিমধ্যেই অর্জন করেছিলাম:
- সবকিছু পুনরাবৃত্তি করুন। আমাদের মূল্যায়নে একটি পরিচিত নয়েজ ফ্লোর রয়েছে (একই রানের মধ্যে 100-পয়েন্ট স্কেলে ~4 পয়েন্ট)। এর চেয়ে ছোট যেকোনো একক-রান তুলনা জেনারেটরের মেজাজ পরিমাপ করছে মাত্র। নিচের প্রতিটি সংখ্যা তিনটি রানের গড়, যার বিস্তারও উল্লেখ করা হয়েছে।
- তৈরিকরণ থেকে আলাদাভাবে উদ্ধারের স্কোর করুন। একসাথে করলে তা পর্যবেক্ষণযোগ্যতাকে বাধা দেয়।
- আপনার অনুবাদ যাচাই করুন। মূল্যায়নের প্রশ্নগুলো মেশিন-অনুবাদ করা হয়েছিল, এরপর একটি স্বতন্ত্র মডেল দ্বারা রাউন্ড-ট্রিপ চেক করা হয়েছিল এবং একটি তৃতীয় মডেল দিয়ে অর্থগত সমতুল্যতা বিচার করা হয়েছিল। বেঁচে থাকার হার: বাংলা 32/40, সোয়াহিলি 25/40, হাউসা 22/40 — এবং একটি বাংলা ফ্ল্যাগ ছিল নীরব হাম-কলেরা প্রতিস্থাপন। এটি নিজেই একটি আবিষ্কার: কথোপকথন নিয়ে আপনি যা-ই করুন না কেন, মেশিন-অনুবাদিত কন্টেন্ট-এর পর্যালোচনা প্রয়োজন।
- আপনার বিচারকের ওপর বিশ্বাস রাখবেন না। হাউসার ফলাফলগুলো একটি ভিন্ন ফ্যামিলির দ্বিতীয় মডেল দ্বারা পুরোপুরি পুনর্বিচার করা হয়েছিল। র্যাঙ্কিং টিকে ছিল; পরম সংখ্যাগুলো পরিবর্তিত হয়েছিল। উভয়ই রিপোর্ট করুন।
আবিষ্কার 1 — তৈরিকরণ: একটি মডেল ভাষা-সমরূপ
আমরা তিনটি প্রার্থী মডেলকে সঠিক ইংরেজি প্রমাণ এবং প্রতিটি ভাষায় প্রশ্ন দিয়েছিলাম, যেখানে উত্তরটি সেই ভাষায় দেওয়ার নির্দেশ ছিল। এটি উদ্ধার থেকে ক্রস-লিঙ্গুয়াল তৈরিকরণকে সম্পূর্ণ আলাদা করে।
| মডেল | ইংরেজি | বাংলা | সোয়াহিলি | হাউসা |
|---|---|---|---|---|
| gemma-4-26b | 0.79 | 0.88 | 0.81 | 0.78 |
| qwen3.6-35b | 0.80 | 0.73 | 0.84 | 0.65 |
| mistral-small-3.2 | 0.85 | 0.82 | 0.81 | 0.31 |
একটি মডেল — Gemma — তিনটি ভাষাতেই নিজের ইংরেজি স্কোরকে আবদ্ধ করে রাখে। একটি মডেল হাউসায় সম্পূর্ণ ব্যর্থ হয়। এবং সবচেয়ে শিক্ষণীয় ব্যর্থতাটি স্কোরের মধ্যেই ছিল না: mistral-small সময়ের 32% ক্ষেত্রে বাংলা প্রশ্নের উত্তর ইংরেজিতে দিয়েছিল, স্পষ্ট নির্দেশনা থাকা সত্ত্বেও। এর কন্টেন্ট ঠিক ছিল; কিন্তু এর ভাষা অনুযায়ী কাজ করাটা ছিল না। একটি LLM বিচারক এটি ধারাবাহিকভাবে মিস করেছিল — উত্তরটির ইউনিকোড স্ক্রিপ্ট চেক করা একটি পাঁচ-লাইনের স্ক্রিপ্ট এটি প্রতিবার ধরে ফেলেছিল। যেখানে আপনি একটি লিখতে পারেন, সেখানে সস্তা ডিটারমিনিস্টিক চেক মডেল বিচারকদের চেয়ে ভালো কাজ করে।
আবিষ্কার 2 — উদ্ধার: দর্পণের প্রতিবিম্ব
এরপর একই প্রশ্নগুলো লাইভ কর্পাসের বিরুদ্ধে কুয়েরি হিসেবে চালানো হয়েছিল, এটি পরীক্ষা করার জন্য যে আমাদের এমবেডিং মডেল (bge-m3) অ-ইংরেজি টেক্সট থেকে ইংরেজি অংশগুলো উদ্ধার করতে পারে কিনা। ইংরেজি কন্ট্রোল আমাদের প্রোডাকশন বেসলাইন হুবহু পুনরুত্পাদন করেছিল — এতে বিশ্বাস করার আগে সর্বদা হারনেসটি যাচাই করুন।
| কুয়েরির ভাষা | MRR | যে প্রশ্নগুলো কখনো উদ্ধার হয়নি |
|---|---|---|
| ইংরেজি | 0.81 | 40-এর মধ্যে 0 |
| বাংলা | 0.79 | 40-এর মধ্যে 0 |
| সোয়াহিলি | 0.66 | 40-এর মধ্যে 2 |
| হাউসা | 0.37 | 40-এর মধ্যে 15 |
বাংলা ইংরেজির সমকক্ষ হারে উদ্ধার করে। হাউসা ধসে পড়ে — এবং শুধুমাত্র যাচাইকৃত-পরিচ্ছন্ন অনুবাদগুলোর ওপর পুনঃস্কোরিং করে মেশিন-অনুবাদ নয়েজ বাদ দেওয়া হয়েছিল (একই ফলাফল)। এমবেডিং মডেলটি স্রেফ পর্যাপ্ত হাউসা দেখেনি, যা এই মডেল ক্লাসের জন্য আফ্রিকান-ভাষা রিট্রিভাল সাহিত্যে (AfriMTEB) রিপোর্ট করার সাথে মিলে যায়।
দুটি আবিষ্কারকে পাশাপাশি রাখলে স্থাপত্যটি নিজে থেকেই ডিজাইন হয়ে যায়:
হাউসা ভালোভাবে তৈরি করে কিন্তু খারাপভাবে উদ্ধার করে — যা শুরুতে আমাদের অনুমানের ঠিক বিপরীত। তাই হাউসার সাহায্যের প্রয়োজন কেবল সেই জায়গায় যেখানে কুয়েরি এমবেডারের সাথে মিলিত হয়। উদ্ধারের জন্য কুয়েরি অনুবাদ করুন; প্রমাণ থেকে নেটিভলি উত্তর দিন। উত্তর পথটি কখনোই মেশিন অনুবাদকে স্পর্শ করে না।
আমরা সেইদিনই বিকেলে সেই পিভটটি পরিমাপ করেছিলাম: NLLB-200 (1.3B ডিস্টিল্ড মডেল, CPU-তে, প্রতি কুয়েরিতে কয়েক সেকেন্ড) ব্যবহার করে হাউসা কুয়েরিগুলো ইংরেজিতে অনুবাদ করা উদ্ধারকে 0.37 MRR থেকে 0.70-এ উন্নীত করেছে — যা নেটিভ সোয়াহিলিরও উপরে — এবং কখনো-উদ্ধার-না-হওয়া প্রশ্নের সংখ্যা 15 থেকে কমিয়ে 2-এ এনেছে। যে ভাষাকে আমরা সকালে 'অসেবযোগ্য' বলে ডাকতাম, সন্ধ্যার মধ্যে তার একটি প্রমাণিত এন্ড-টু-এন্ড স্থাপত্য তৈরি হয়ে গেল, এবং এই সমাধানের খরচ হলো একটি ভাষার কুয়েরির ক্ষেত্রে CPU-সেকেন্ড অনুবাদের একটি ধাপ।
আবিষ্কার 3 — রেডাকশন: ফাঁদগুলো সবই নীরব
গোপনীয়তা স্তরটি ছিল সবচেয়ে বড় ঘাটতি: শিল্প-মানের PII ফ্রেমওয়ার্কে এই ভাষাগুলোর জন্য কোনো মডেলই নেই। আমরা একটি দ্বিতীয় অ্যানালাইজার সার্ভিস যুক্ত করেছি — আফ্রিকান ভাষা এবং বাংলা কর্পাসের ওপর প্রশিক্ষিত ট্রান্সফর্মার NER মডেল — যেখানে বিদ্যমান, ইতিমধ্যে পরিমাপকৃত অ্যানালাইজারটি অক্ষত রাখা হয়েছে। দুটি সার্ভিস রাখার কারণ হলো, কভারেজ বাড়ালেও ইতিমধ্যে পরিমাপকৃত বিষয়টি যেন কখনো নীরবে পিছিয়ে না যায়।
ডেপ্লয়মেন্টের আগে রিকল পরিমাপ করে ত্রুটি শনাক্ত করা হয়েছে, যার প্রতিটি কোড রিভিউতে অদৃশ্য থাকত:
- রেডাক্টরটি "beneficiary" শব্দটি মুছে দিয়ে আসল নামটি ফাঁস করে দিয়েছিল। বাংলা মডেলের টোকেনাইজার স্বরচিহ্ন সরিয়ে ফেলে; ডিফল্ট স্প্যান অ্যাগ্রিগেশনের অধীনে নামের টুকরোগুলো অ্যালাইনমেন্টে বাদ পড়ে যায়। একটি কনফিগ মান (
aggregation: max) এটি ঠিক করেছে — কিন্তু শুধুমাত্র রিকল পরিমাপই এটি দেখাতে পারত। - ফ্রেমওয়ার্কের কনটেক্সট বুস্টার কখনোই সক্রিয় হয়নি। আইডি প্যাটার্নগুলো রেডাকশন থ্রেশহোল্ডের ঠিক নিচে স্কোর করছিল, পাশেই একটি নিখুঁত কনটেক্সট শব্দ ("NID", "kitambulisho") থাকার পরেও, কারণ মাল্টিলিঙ্গুয়াল টোকেনাইজার বুস্টারের মেলানোর জন্য কোনো লেমা প্রদান করে না। সংখ্যাগুলো যুক্তিসঙ্গত মনে হচ্ছিল; তারা পদ্ধতিগতভাবে এক ধাপ কম ছিল।
- "Common Article 3" হয়ে গেল
<PERSON_1>। হাউসা ভাষায়, NER মডেলটি জেনেভা কনভেনশনের একটি প্রশ্নের উদ্ধৃতি শুরুকারী অংশটিকে একজন ব্যক্তি হিসেবে চিহ্নিত করেছিল — যা নীরবে কর্পাসের অন্যতম গুরুত্বপূর্ণ কুয়েরিটি ধ্বংস করে দিত। ডোমেইন-ভোকাবুলারি অ্যালাউলিস্ট ঠিক এই জন্যই বিদ্যমান।
ডেপ্লয় করা সিস্টেমটি এখন আমাদের লেবেলযুক্ত কর্পাসে 120/120 রিকল পরিমাপ করে — এবং আমরা সেই সংখ্যাটি এর সতর্কতা সহ প্রকাশ করি: কর্পাসটি সেই একই ফরম্যাট নিয়ম থেকে তৈরি যা রিকগনাইজারগুলো এনকোড করে, তাই সেই স্কোরের একটি অংশ টটোলজিক্যাল। যখন আমাদের ইউক্রেনীয়/রাশিয়ান রেডাকশন একটি সত্যিকারের হেল্ড-আউট টেস্ট সেটের মুখোমুখি হয়েছিল, তখন ~100% হয়ে গিয়েছিল 84.2%। এই ভাষাগুলোর জন্য আমরা এই সংখ্যাটিই উদ্ধৃত করি, এবং নতুন তিনটি ভাষার জন্য তাদের হেল্ড-আউট সেট তৈরি না হওয়া পর্যন্ত কোনো পাবলিক সংখ্যা দেওয়া হয় না। উৎস ছাড়া কোনো রিকল পরিসংখ্যান হলো মার্কেটিং, প্রমাণ নয়।
আবিষ্কার 4 — পরিমাপ নিজের খরচ তুলে নেয় এমন বাগগুলোতে যা আপনি খুঁজছিলেন না
লেক্সিক্যাল সার্চ স্তরটিকে ইউনিকোড-সচেতন করার সময় (এটি আগে প্রতিটি বাংলা অক্ষর বাদ দিত), আমরা দেখতে পেলাম যে টোকেনাইজার কখনোই ইউক্রেনীয় অক্ষর "ї"-এর সাথে মিলতে পারেনি — রেগেক্সে একটি এক-অক্ষরের ফাঁক, যা ফিচারটি চালু হওয়ার পর থেকে কীওয়ার্ড সার্চে অধিকাংশ ইউক্রেনীয় শব্দকে নীরবে বিভক্ত করছিল। কেউ এটি লক্ষ্য করেনি, কারণ হাইব্রিড রিট্রিভাল ব্যর্থ হওয়ার পরিবর্তে সুচারুভাবে অবনতি হয়েছিল। সেই বাগটি কোনো বাগ রিপোর্টের মাধ্যমে নয়, বরং একটি প্রোব যুক্তিসঙ্গত সংখ্যা তৈরি করতে অস্বীকার করার মাধ্যমে ধরা পড়েছিল।
একই প্যাটার্নটি সারাদিন জুড়ে পুনরাবৃত্তি হয়েছিল। ব্যাক-ট্রান্সলেশন QA হাউসা অনুবাদগুলোর 40টির মধ্যে 32টিকে ভাঙা হিসেবে চিহ্নিত করেছিল — যতক্ষণ না আমরা চেকার-টি পরীক্ষা করে দেখলাম যে ব্যাক-ট্রান্সলেশন মডেলটিই হাউসা ভুল পড়ছিল ("toilet" হয়ে গিয়েছিল "distance from home")। রিডারটি পরিবর্তন করলে, 40টির মধ্যে 22টি বেঁচে যায়। প্রতিটি পরিমাপ যন্ত্রই নিজেও একটি পরিমাপযোগ্য বস্তু।
স্ব-হোস্টিং প্রশ্ন, অবশেষে একটি সংখ্যাসহ
অধিবেশনের শেষ পরীক্ষাটি একটি ভিন্ন চলমান প্রশ্নের সমাধান করেছিল: প্রোডাকশন মডেলটি স্ব-হোস্ট করা আসলে গুণগত মানের ক্ষেত্রে কতটা খরচ সাপেক্ষ? আমরা একই মডেলটি দুইভাবেই পরিবেশন করেছি — পূর্ণ নির্ভুলতায় হোস্টেড API, এবং আমাদের নিজস্ব GPU-তে 4-বিট কোয়ান্টাইজড কপি — এবং অভিন্ন মূল্যায়ন চালিয়েছি, প্রতিটি আর্মের জন্য তিনবার করে।
| আর্ম | স্কোর | রান স্প্রেড |
|---|---|---|
| হোস্টেড API (bf16) | 0.872 | 0.008 |
| স্ব-হোস্টেড (int4) | 0.809 | 0.038 |
int4-এ কোয়ান্টাইজেশন প্রায় 6 পয়েন্ট খরচ করে, যা উভয় আর্মের নয়েজের বাইরে। এটি একটি অস্পষ্ট স্থাপত্যগত বিতর্ককে একটি সিদ্ধান্তের নিয়মে রূপান্তরিত করে: মূল্যের সমতায় গুণগত মান-সংবেদনশীল ট্রাফিককে int4 আর্মের দিকে রুট করবেন না। স্ব-হোস্টেড রুটটি বিক্রি হয় তার আসল উদ্দেশ্যের ওপর ভিত্তি করে — একটি সার্বভৌমত্বের প্রয়োজনীয়তা যা ক্লায়েন্টের জন্য অর্থপ্রদান করে — এর পরিমাপকৃত গুণগত খরচ শুরুতেই উল্লেখ করে, এবং প্রোডাকশন-ক্লাস হার্ডওয়্যারে FP8-কে সমতা পরীক্ষা হিসেবে কিউতে রাখা হয়েছে।
আরেকটি ইনস্ট্রুমেন্টেশন শিক্ষা: এই তুলনার প্রথম রানটি ডেল্টাটিকে নয়েজ ফ্লোরের ভেতরে হিসেবে রিপোর্ট করেছিল। বারোটি উত্তর শূন্য স্কোর পেয়েছিল কারণ জাজের API রান-এর মাঝখানে রেট-লিমিট করেছিল — একটি অবকাঠামোগত ব্যর্থতা যা গুণগত মানের সংকেত হিসেবে ছদ্মবেশ ধারণ করেছিল। শুধুমাত্র প্রতি-রেকর্ড ব্যর্থতা লগিং এটি দৃশ্যমান করেছিল। সেই বারোটি পুনরায় বিচার করলে, রায়টি উল্টে যায়। যদি আপনার মূল্যায়ন আপনাকে বলতে না পারে কেন একটি রেকর্ড শূন্য স্কোর পেয়েছে, তবে এটি শেষ পর্যন্ত আপনার কাছে মিথ্যা বলবে।
এর খরচ কত ছিল, এবং আমরা এখনও কী জানি না
পুরো তদন্তটি — চারটি ভাষা এবং তিনটি মডেল জুড়ে দুটি প্রোব, একটি রিট্রিভাল পিভট পরীক্ষা, একটি ডেপ্লয় এবং যাচাইকৃত রেডাকশন সম্প্রসারণ, এবং একটি পরিমাপকৃত স্ব-হোস্টিং সিদ্ধান্ত — API টোকেনে এক অঙ্কের ইউরো এবং শূন্য ভাড়া করা GPU-ঘণ্টা খরচ করেছে। ব্যয়বহুল দেখানো প্রশ্নটির ("আমাদের কি €1,000/মাসের GPU প্রয়োজন?") উত্তর একটি কফির দামে পাওয়া গেছে, এবং উত্তরটি ছিল "এখনও নয়, এবং এখানে সেই সংখ্যাটি আছে যা আমাদের বলবে কখন প্রয়োজন হবে।"
ততটাই গুরুত্বপূর্ণ হলো প্রমাণটি এখনও কী সমর্থন করে না, কারণ সেই তালিকাটি প্রকাশ করাই বাকি অংশকে বিশ্বাসযোগ্য করে তোলে:
- 120/120 রেডাকশন রিকল হলো একটি ওয়্যারিং প্রমাণ, প্রোডাকশন দাবি নয় — প্রতিটি ভাষার জন্য হেল্ড-আউট সেট আগে আসে।
- প্রোব স্কোরগুলো প্রোডাকশন স্কোর নয়; গোল্ড প্রমাণ জেনারেশনকে লাইভ রিট্রিভাল লুপের চেয়ে সহজ করে তোলে।
- অনুবাদগুলো শুধুমাত্র মেশিন QA পার করেছে; ব্যবহারকারী-মুখী যেকোনো কিছুর জন্য নেটিভ স্পিকার রিভিউ অপেক্ষমান।
- ডিটেকশন আমাদের মূল্যায়ন রেজিস্টারে পরিমাপ করা হয়েছে, কথ্য চ্যাট, কোড-সুইচিং, বা রোমানাইজড বাংলার ওপর নয়।
- উপরের প্রতিটি সংখ্যা হলো পুনরাবৃত্ত রানের ওপর গড় যার সাথে এর স্প্রেড রয়েছে — এবং হাউসা জেনারেশন সংখ্যাগুলো অন্যগুলোর চেয়ে বেশি অনিশ্চয়তা বহন করে, কারণ দুজন জাজও শেষ পর্যন্ত কেবল দুজন জাজ।
পদ্ধতিটিই মূল শিক্ষা। এর কোনো কিছুই বিরল অবকাঠামো বা গবেষণা বাজেটের প্রয়োজন হয়নি। এটি পরিমাপ থেকে নেওয়া স্থাপত্যগত সিদ্ধান্তের ওপর ভিত্তি করে — এবং প্রতিটি আশ্চর্যজনক সংখ্যাকে বিশ্বের একটি তথ্য হিসেবে বিশ্বাস করার আগে যন্ত্র সম্পর্কে একটি প্রশ্ন হিসেবে বিবেচনা করার ওপর ভিত্তি করে।
এই নিবন্ধের পেছনের সম্পূর্ণ প্রমাণ প্যাক — দাবি লেজার, কাঁচা ফলাফল, এবং প্রতিটি দাবি কী প্রদর্শন করে এবং কী করে না তার তালিকা — আমাদের সার্বভৌম এজেন্ট রেফারেন্স আর্কিটেকচারের অংশ।
বোনাস হিসেবে, আমরা একই পরিমাপ-প্রথম পাইপলাইন খোদ সাইটের ওপর প্রয়োগ করেছি — baena.ai এখন বাংলা, সোয়াহিলি এবং হাউসায় মেশিন-অনূদিত, ঠিক এই একই তিনটি ভাষা যা নিয়ে এই নিবন্ধ — যাতে এই লেখাটি, এবং সাইটের বাকি অংশ, যাদের জন্য এগুলো আসলে তৈরি তাদের কাছে পৌঁছানো সহজ হয়।
যদি আপনি মানবিক বা সরকারি খাতের জন্য AI তৈরি করেন যেখানে ডেটা রেজিডেন্সি এবং পরিমাপযোগ্য সুরক্ষা ব্যবস্থা চুক্তিবদ্ধ, তবে এটিই আমাদের প্রয়োগ পদ্ধতি।
