Msaidizi wetu wa kibinadamu anajibu maswali kuhusu kanuni za kawaida za sekta — Mwongozo wa Sphere, Mkataba wa Geneva, Mkataba wa Wakimbizi wa 1951 na ndugu zao — kutoka kwenye hazina tunayomeza na kuweka ndani wenyewe, nyuma ya mpaka wa kutoka ambapo kila wito wa mfumo unarekodiwa, kufutwa taarifa binafsi, na kuweza kuhusishwa na chanzo. Hazina hiyo iko kwa Kiingereza. Watu wanaohitaji mara nyingi hawazungumzii Kiingereza.
Kwa hiyo, tuliamua kuongeza lugha tatu: Bangla, Kiswahili na Hausa. Pamoja, zinashughulikia muktadha wa kibinadamu kutoka Cox's Bazar hadi Sahel. Kila moja, ni tatizo tofauti sana la uhandisi — ambalo tunalijua tu kwa sababu tulipima kila moja kabla ya kujenga chochote.
Hii ni hadithi ya vipimo hivyo: gharama zake (euro chache tu), kile vilichogundua, na njia ya kufanya kazi iliyofanya usanifu uibuke kutoka kwenye data badala ya kutoka kwenye maoni yaliyotangulia.
Tabaka nne, njia nne za kushindwa
Lugha ha "unga mkono" kwa sababu kadi ya mfumo inasema hivyo. Kwa mtumiaji anaandika kwa Bangla, tabaka nne huru lazima zifanye kazi:
- Gundua — jua lugha gani ujumbe ulioandikwa. Heuristics zetu zilizopo, zilizojengewa dunia ya Kiukreni/Kirusi/Kiingereza, ziliainisha lugha zote tatu mpya kama Kiingereza.
- Rejesha — tafuta sehemu sahihi za Kiingereza kutoka kwenye swali lililoandikwa kwa lugha nyingine. Urejeshaji wa kuvuka lugha ni kazi ya mfumo wa embedding.
- Zalisha — jibu kwa lugha ya mtumiaji, ukiwa umeegemea ushahidi wa Kiingereza, bila kurejelea mtoaji anayevunja ahadi za uhifadhi wa data.
- Futa taarifa binafsi — shika majina, nambari za simu na vitambulisho vya taifa kabla ya chochote kuvuka mpaka. Shindwa kwa usalama, kwa kila lugha.
Kila tabaka inaweza kushindwa peke yake, lakini kinatokea kuwa zinashindwa kwa njia tofauti kulingana na lugha.
Pima kwanza, usikodishe chochote
Kabla ya kujitolea kwa usanifu wowote (au GPU yoyote), tulifanya vipimo viwili kwenye kiwango cha utambuzi cha Ulaya kisicho na seva maalum, kinacholipa kwa kila tokeni. Wito wa mfumo takriban 2,900, chini ya euro tano, hakuna instance iliyowahi kutengenezwa.
Vipimo vilirithi nidhamu ya tathmini tuliyoshalipa ada kwenye mfumo wa Kiingereza:
- Rudia kila kitu. Tathmini yetu ina kiwango kinachojulikana cha kelele (~4 pointi kwenye kipimo cha 100 kati ya mikondo ileile). Kulinganisha kimoja-cha-kimoja kidogo kuliko hapo kunapima tabia ya kizalishaji. Kila nambari hapa chini ni wastani wa mikondo mitatu, ukiwa na uenezi umetajwa.
- Piga alama urejeshaji tofauti na uzalishaji. Kufanya hivyo pamoja kunazuia uwezo wa kuona na kufuatilia.
- Thibitisha tafsiri zako. Maswali ya tathmini yalifanyiwa tafsiri ya mashine, kisha yakakaguliwa tena na mfumo hurufu huku mfumo wa tatu ukiamua usawa wa maana. Viwango vya kuishi: Bangla 32/40, Kiswahili 25/40, Hausa 22/40 — na bendera moja ya Bangla ilikuwa ubadilishaji wa kimya kati ya surua na kipindupindu. Hilo lenyewe ni gunduzi: maudhui yaliyotafsiriwa na mashine yanahitaji ukaguzi, chochote unachofanya kuhusu mazungumzo.
- Usiamini hakimu wako. Matokeo ya Hausa yalihakimiwa tena kamili na mfumo wa pili kutoka kwa familia tofauti. Orodha ya nafasi ilibaki; nambari kamili zilibadilika. Ripoti zote mbili.
Gunduzi la 1 — Uzalishaji: mfumo mmoja ni sawa kwa lugha zote
Tuliwapa mifumo mitatu inayowania ushahidi sahihi wa Kiingereza na swali kwa kila lugha, tukihitaji jibu kwa lugha hiyo. Hii inatenganisha uzalishaji wa kuvuka lugha kutoka kwa urejeshaji kabisa.
| Mfumo | Kiingereza | Bangla | Kiswahili | Hausa |
|---|---|---|---|---|
| gemma-4-26b | 0.79 | 0.88 | 0.81 | 0.78 |
| qwen3.6-35b | 0.80 | 0.73 | 0.84 | 0.65 |
| mistral-small-3.2 | 0.85 | 0.82 | 0.81 | 0.31 |
Mfumo mmoja — Gemma — unazunguka alama yake ya Kiingereza katika lugha zote tatu. Mfumo mmoja unashindwa kabisa Hausa. Na kushindwa kunaofundisha zaidi hakukuwa kwenye alama kabisa: mistral-small ilijibu maswali ya Bangla kwa Kiingereza mara 32% ya wakati, licha ya maagizo wazi. Maudhui yake yalikuwa sawa; utii wake wa lugha haukuwa. Hakimu wa LLM alikosa hili mara kwa mara — skripti ya mistari mitano iliyokagua nukuu ya Unicode ya jibu ililigundua kila wakati. Ukaguzi rahisi na unaobainika unashinda mahakimu wa mfumo popote unapoweza kuandika mmoja.
Gunduzi la 2 — Urejeshaji: picha ya kioo
Kisha maswali yale yale yalienda dhidi ya hazina hai kama mihoji, yakijaribu kama mfumo wetu wa embedding (bge-m3) unaweza kurejesha sehemu za Kiingereza kutoka kwenye maandishi yasiyo ya Kiingereza. Udhibiti wa Kiingereza ulirudisha msingi wetu wa uzalishaji haswa — thibitisha daima zana kabla ya kuiamini.
| Lugha ya hoji | MRR | Maswali ambayo hayakurejeshwa kamwe |
|---|---|---|
| Kiingereza | 0.81 | 0 kati ya 40 |
| Bangla | 0.79 | 0 kati ya 40 |
| Kiswahili | 0.66 | 2 kati ya 40 |
| Hausa | 0.37 | 15 kati ya 40 |
Bangla inarejesha kwa usawa na Kiingereza. Hausa inaporomoka — na kelele ya tafsiri ya mashine ilikatiliwa kwa kupiga alama tena kwenye tafsiri zilizothibitishwa kuwa safi tu (matokeo yale yale). Mfumo wa embedding simply haujaona Hausa ya kutosha, ambayo inalingana na kile fasihi ya urejeshaji wa lugha za Kiafrika (AfriMTEB) inaripoti kwa darasa hili la mfumo.
Weka gunduzi hivi viwili kando na usanifu unajiunda wenyewe:
Hausa inazalisha vizuri na kurejesha vibaya — kinyume kabisa na dhana yetu ya awali. Kwa hiyo, Hausa inahitaji msaada pale tu ambapo hoji inakutana na kifaa cha embedding. Tafsiri hoji kwa ajili ya urejeshaji; jibu kiasilia kutoka kwenye ushahidi. Njia ya jibu haigusi kamwe tafsiri ya mashine.
Tulipima mabadiliko hayo mchana uleule: kutafsiri mihoji ya Hausa kwenda Kiingereza kwa kutumia NLLB-200 (mfumo uliofupishwa wa 1.3B, kwenye CPU, sekunde chache kwa hoji) iliongeza urejeshaji kutoka MRR 0.37 hadi 0.70 — juu ya Kiswahili cha asilia — na kupunguza maswali ambayo hayakurejeshwa kamwe kutoka 15 hadi 2. Lugha ambayo tungeita kuwa haiwezi kuhudumiwa asubuhi ilikuwa na usanifu uliothibitishwa wa mwanzo hadi mwisho jioni, na marekebisho yanagharimu hatua ya tafsiri ya sekunde chache za CPU kwenye mihoji ya lugha moja.
Utoaji wa 3 — Kuficha Taarifa: Mitego yote ni ya kimya
Safu ya faragha ilikuwa pengo kubwa zaidi: mfumo wa kiwango cha sekta wa PII hauna mifano kabisa kwa lugha hizi. Tuliongeza huduma ya pili ya uchambuzi — mifano ya transformer NER iliyofunzwa kwa korpusi za lugha za Kiafrika na Kibangla — huku tukiiacha ile iliopo, ambayo tayari imepimwa, ikiwa haijagusiwa. Huduma mbili, ili kupanua ufunikaji kamwe kusiweze kurudisha nyuma kimya kimya kile ambacho tayari umekipima.
Kupima ukumbukumbu (recall) kabla ya utumiaji kugundua kasoro tatu, ambazo zote zingelikuwa zisizoonekana katika ukaguzi wa msimbo:
- Kifichaji kilificha neno "mnufaika" na kuvujisha jina halisi. Kigawanyaji maneno (tokenizer) cha mfano wa Kibangla huondoa alama za vokali; chini ya kujumlisha kwa nasibu chaguomsingi, sehemu za jina ziliachwa wakati wa kupanga. Thamani moja ya usanidi (
aggregation: max) iliirekebisha — lakini ni kipimo cha ukumbukumbu pekee kingelionyesha hilo. - Kichocheo cha muktadha cha mfumo hakikuanza kamwe. Mifumo ya ID ilipata alama chini kidogo ya kizingiti cha kuficha huku ikiwa imeketi karibu na neno kamili la muktadha ("NID", "kitambulisho"), kwa sababu kigawanyaji maneno cha multilingual hakitoi lema ambazo kichocheo kingelinganisha. Namba zilionekana kuwa na mantiki; zilikuwa kwa utaratibu chini kwa kiwango kimoja.
- "Common Article 3" ikawa
<PERSON_1>. Katika Kihausa, mfano wa NER uliweka lebo ya mwanadamu kwenye kifungu cha kufungua nukuu ya swali la Mikataba ya Geneva — ambacho kingeliharibu kimya kimya mojawapo ya miulizo muhimu zaidi kwenye korpusi. Orodha za kuruhusu msamiati wa kikoa zipo hasa kwa ajili ya hili.
Mfumo uliotumika sasa unapima ukumbukumbu wa 120/120 kwenye korpusi yetu iliyowekwa lebo — na tunachapisha namba hiyo pamoja na onyo lake: korpusi imejengwa kutoka kwa kanuni za muundo sawa ambazo vitambuzi vinazisimbiza, hivyo sehemu ya alama hiyo ni tautolojia. Wakati ufichaji wetu wa Kiukreni/Kirusi ulipokutana na seti ya majaribio iliyotengwa kweli, ~100% ikawa 84.2%. Hiyo ndiyo namba tunayonukuu kwa lugha hizo, na lugha mpya tatu hazipati namba ya umma hadi seti zao za majaribio zipo. Takwimu ya ukumbukumbu bila asili yake ni uuzaji, si ushahidi.
Utoaji wa 4 — Upimaji unalipa gharama zake kupitia makosa ambayo hukuwa unayatafuta
Kufanya safu ya utafutaji wa maneno iwe na uelewa wa Unicode (hapo awali ilikuwa inatupa kila herufi ya Kibengali), tuligundua kuwa kigawanyaji maneno (tokenizer) hakukuwahi kulinganisha herufi ya Kiukreni "ї" — pengo la herufi moja katika regex ambalo lilikuwa likigawanya kimya kimya manema mengi ya Kiukreni katika utafutaji wa maneno muhimu tangu kipengele hicho kilipotolewa. Hakuna aliyegundua, kwa sababu urejeshaji wa mchanganyiko (hybrid retrieval) ulipungua kwa utaratibu badala ya kushindwa. Hitilafu hiyo haikugunduliwa na ripoti ya hitilafu bali na uchunguzi uliokataa kutoa namba yenye mantiki.
Mfano huo huo ulirudiwa mchana kote. Uhakiki wa ubora (QA) wa kutafsiri nyuma ulibainisha kuwa 32 kati ya 40 za tafsiri za Kihausa zimeharibika — hadi tulipoikagua kikagua chenyewe na kupata kuwa mfano wa kutafsiri nyuma ndio ulikuwa unasoma vibaya Kihausa ("choo" ikawa "umbali kutoka nyumbani"). Badilisha kisomaji, na 22 kati ya 40 zinaokoka. Kila chombo cha upimaji yenyewe ni kitu kinachohitaji kupimwa.
Swali la ujenyeji (self-hosting), hatimaye likiwa na namba
Majaribio ya mwisho ya kipindi hiki yalishughulikia swali lingine lililokuwa likisubiri: je, ujenyeji wa mfano wa uzalishaji unagharimu nini hasa kwa ubora? Tulitoa mfano huo huo kwa njia zote mbili — API iliyoandikishwa kwenye wingu ikiwa na usahihi kamili, na nakala iliyopunguzwa hadi biti 4 (4-bit quantized) kwenye GPU yetu wenyewe — na tukafanya tathmini ileile, mara tatu kwa kila upande.
| Upande | Alama | Upana wa kazi |
|---|---|---|
| API iliyoandikishwa (bf16) | 0.872 | 0.008 |
| Ilijenyeshwa (int4) | 0.809 | 0.038 |
Kupunguza hadi int4 kunagharimu alama takriban 6, nje ya kelele za pande zote mbili. Hii inabadilisha mjadala usio wazi wa usanifu kuwa kanuni ya uamuzi: usielekeze trafiki nyeti kwa ubora kwenye upande wa int4 ikiwa bei ni sawa. Njia ya kujijengeza inauzwa kwa kile ambacho imeundwa kweli — hitaji la uhuru ambalo mteja analipa — huku gharama yake ya ubora iliyopimwa ikibainishwa mapema, na FP8 kwenye vifaa vya daraja la uzalishaji ikisubiri kama jaribio la usawa.
Somo lingine la ufuatiliaji: kazi ya kwanza ya ulinganisho huu iliripoti tofauti kama ikiwa ndani ya kiwango cha kelele. Majibu kumi na mawili yalipata alama sifuri kwa sababu API ya mhakimu ilizuia kasi katikati ya kazi — hitilafu ya miundombinu iliyojifanya kuwa ishara ya ubora. Ni rekodi ya kushindwa kwa kila rekodi pekee ndiyo iliyofanya ionekane. Hakiki majibu hayo kumi na mawili tena, na hukumu inageuka. Ikiwa tathmini yako haiwezi kukuambia kwa nini rekodi ilipata alama sifuri, hatimaye itakudanganya.
Gharama yake, na kile ambacho bado hatujui
Uchunguzi wote — uchunguzi mbili katika lugha nne na mifano mitatu, jaribio la kubadilisha urejeshaji, upanuzi wa kuficha taarifa uliotumika na kuthibitishwa, na uamuzi wa ujenyeji uliopimwa — iligharimu euro chache sana katika tokeni za API na saa sifuri za GPU zilizokodishwa. Swali lililoonekana ghali ("je, tunahitaji GPU ya €/mwezi 1,000?") lilijibiwa kwa bei ya kahawa, na jibu lilikuwa "bado hapana, na hii ndiyo namba itakayotuambia lini."
Muhimu sawa ni kile ambacho ushahidi bado hauungi mkono, kwa sababu kuchapisha orodha hiyo ndicho kinachofanya yaliyobaki yawe ya kuaminika:
- Ukumbukumbu wa 120/120 wa kuficha taarifa ni uthibitisho wa waya, si dai la uzalishaji — seti zilizotengwa kwa kila lugha zinapaswa kuja kwanza.
- Alama za uchunguzi sio alama za uzalishaji; ushahidi wa dhahabu hufanya uzalishaji uwe rahisi kuliko kitanzi cha urejeshaji moja kwa moja.
- Tafsiri zimepita uhakiki wa mashine pekee; ukaguzi wa wasemaji wa asili unasubiriwa kwa chochote kinachokabiliana na mtumiaji.
- Ugunduzi unapimwa kwenye rejista yetu ya tathmini, si kwenye mazungumzo ya kawaida, kubadilishana lugha, au Kibangla kilichoandikwa kwa herufi za Kirumi.
- Kila namba hapo juu ni wastani wa kazi zilizorudiwa pamoja na upana wake — na namba za uzalishaji wa Kihausa zina uhakika zaidi kuliko nyingine, kwa sababu hata mahakimu wawili bado ni mahakimu wawili tu.
Njia ndiyo somo kuu. Hakuna hapa kilichohitaji miundombinu nadra au bajeti ya utafiti. Inategemea maamuzi ya usanifu yaliyotokana na vipimo — na kuchukua kila namba ya ajabu kama swali kuhusu chombo kabla ya kuiamini kama ukweli kuhusu ulimwengu.
Kifurushi kamili cha ushahidi nyuma ya makala hii — leja ya madai, matokeo ghafi, na orodha ya kile ambacho kila dai inafanya na haionyeshi — ni sehemu ya usanifu wetu wa rejea wa ejenti wenye uhuru.
Kama zawadi ya ziada, tulitumia mfumo huohuo wa kupima-kwanza kwenye tovuti yenyewe: baena.ai sasa imetafsiriwa kimashine kuwa Kibangla, Kiswahili na Kihausa — lugha hizohizo tatu ambazo makala hii inahusu — ili sehemu hii, na tovuti yote, iwe rahisi kufikiwa na watu ambao kwa kweli ndio walengwa.
Unapoendeleza AI kwa ajili ya matumizi ya kibinadamu au ya sekta ya umma ambapo makazi ya data na dhamana zinazopimika ni za mkataba, huu ndio njia ya kufanya kazi tunayotoa.
