← Back to articles

Cilvēks AI ciklā: kā tas darbojas un kad to izmantot

Cilvēks AI ciklā: kā tas darbojas un kad to izmantot

Mākslīgais intelekts ar cilvēku iesaisti (HITL) ir projektēšanas modelis, kurā cilvēka spriedums tiek tieši iebūvēts MI sistēmas lēmumu pieņemšanas vai izpildes ciklā — lai marķētu apmācības datus, pārskatītu modeļa rezultātus vai apstiprinātu aģentu darbības pirms to īstenošanas. Īsā versija: izmantojiet to vienmēr, kad MI var izraisīt reālas sekas, kad kļūdas ir dārgi labojamas vai kad normatīvā atbildība prasa konkrētu cilvēku, kurš uzņemas lēmuma atbildību.

Šajā rakstā aplūkota visa aina — sākot no tā, kā cilpa tiek tehniski izveidota, līdz tam, kā izstrādāt sistēmu, kas uzticami darbojas produkcijas vidē.


Saturs

Kā īsti darbojas MI ar cilvēku iesaisti?

“Cilpa” nav metafora. Tā ir konkrēta kontrolpunktu secība, kurā sistēmā tiek ievadīts cilvēka ieguldījums un sistēma vai nu gaida šo ieguldījumu, vai arī to saņem asinhroni.

Komanda pārskata cilvēka kontrolpunktus MI sistēmā

Pastāv divi atšķirīgi posmi, kuros piedalās cilvēki:

Apmācības posma HITL ietver neapstrādātu datu marķēšanu, modeļa rezultātu kvalitātes novērtēšanu un preferenču signālu sniegšanu. Reinforcement Learning from Human Feedback (RLHF) — tehnika, kas ir pamatā lielākajai daļai lielo valodas modeļu saskaņošanas darba — ir klasisks piemērs. Anotētāji sarindo modeļa atbildes; šie vērtējumi kļūst par atlīdzības signālu, un modelis tiek precizēti apmācīts, izmantojot šo signālu. Saistīts modelis ir aktīvā mācīšanās: modelis atzīmē piemērus, par kuriem ir vismazāk pārliecināts, un cilvēki, kas veic marķēšanu, piešķir tiem prioritāti, tādējādi efektīvāk izmantojot anotēšanas budžetu.

Izpildes laika HITL mūsdienās nodrošina lielāko daļu produkcijas vidē iegūtās vērtības. Aģentiem pārejot no demonstrācijām uz produkcijas vidi, apstiprinājumi pirms darbībām ar ārējām sekām, piemēram, e-pasta nosūtīšanas vai rakstīšanas datubāzē, kļūst par pamatprasību uzņēmumu ieviešanai. Mehānisms darbojas šādi:

“HITL starpprogrammatūra var apturēt aģenta rīku izsaukumus un parādīt pārtraukumu, kurā uzskaitītas darbības, kas jāizskata; sistēma saglabā aģenta stāvokli, lai izpildi pēc cilvēka lēmuma varētu droši atsākt. Parasti atbalstītie lēmumu veidi: apstiprināt, rediģēt, noraidīt, atbildēt; nosacīti pārtraukumi ļauj kontrolēt darbības, pamatojoties uz rīku argumentiem.” — LangChain HITL dokumentācija

Praktiskā plūsma izskatās šādi:

  • Anotēt neapstrādātus datus vai modeļa rezultātus ar cilvēku piešķirtiem marķējumiem
  • Pārtrenēt vai precizēti apmācīt modeli, izmantojot izlabotos piemērus
  • Ieviest atjaunināto modeli vai aģentu produkcijas vidē
  • Pārtraukt izpildi augsta riska rīku izsaukumu gadījumā un novirzīt tos cilvēkam pārskatīšanai
  • Pieņemt lēmumu (apstiprināt / rediģēt / noraidīt / atbildēt) un atsākt izpildi
  • Fiksēt lēmumu kā strukturētu atgriezenisko saiti un nosūtīt to atpakaļ apmācības konveijerā

Šeit svarīga ir atšķirība starp sinhronu un asinhronu apstrādi. Sinhronie (bloķējošie) vārti pilnībā aptur izpildi, līdz pārskatītājs rīkojas. Asinhronie (nebloķējošie) modeļi ļauj aģentam turpināt citus uzdevumus, kamēr tiek gaidīts apstiprinājums. Produkcijas izpildvidēm ir jāsaglabā stāvoklis, jo apstiprinājumi var aizņemt minūtes, stundas vai pat dienas; tādēļ atmiņā glabāts stāvoklis nav pietiekams nekam vairāk par lokālu testu.

Aģenta konfigurācijā var norādīt konkrētus rīkus, kuriem nepieciešams apstiprinājums, un iestatīt nosacījumus, lai pārtraukums tiktu aktivizēts tikai noteiktu izsaukuma argumentu gadījumā. Šāda detalizācijas pakāpe palīdz uzturēt pārskatītāju rindas pārvaldāmā apjomā un novērš brīdinājumu nogurumu.

Infografika, kas parāda MI ar cilvēku iesaisti procesa soļus


Kāpēc HITL ir svarīgs: precizitāte, drošība un uzticēšanās

Biznesa pamatojums cilvēka uzraudzībai MI sistēmās nav abstrakts. Produkcijas ieviešanās konsekventi parādās trīs konkrēti ieguvumi.

Precizitāte nestandarta gadījumos. Modeļi, kas apmācīti ar vēsturiskajiem datiem, kļūst neprecīzi, kad pasaule mainās vai ievades dati atrodas ārpus apmācības sadalījuma. Cilvēks, kas veic pārskatīšanu, pamana anomāliju; labojums, ja tas tiek pienācīgi fiksēts, kļūst par apmācības datiem, kas uzlabo nākamo modeļa versiju. Cilpa nodrošina, ka sistēma pati sevi koriģē, nevis klusi kļūdās.

Drošākas darbības. MI aģents, kas var nosūtīt e-pastus, atjaunināt ierakstus vai apstrādāt atmaksas, var nodarīt reālu kaitējumu, ja rīkojas, pamatojoties uz nepareizi klasificētu ievadi. Apstiprināšanas vārti pirms rīku izsaukumiem ar ārējām sekām ir tiešs risinājums šī riska mazināšanai. HITL ir visefektīvākais, ja cilvēka pārskatīšana tiek rezervēta lēmumiem ar lielu ietekmi, nevis piemērota katram rezultātam. Tāpēc nobriedušās ieviešanās parasti izmanto uz riskiem balstītu maršrutēšanu ar pārliecības sliekšņiem un riska vērtēšanu.

Auditācijas pēdas un izskaidrojamība. Katrs cilvēka lēmums labi instrumentētā HITL sistēmā ir ieraksts ar laika zīmogu: kas to pārskatīja, kāds bija lēmums un ko aģents darīja pēc tam. Šāds žurnāls ir nepieciešams regulatoriem, atbilstības komandām un incidentu izmeklētājiem. Bez tā jums ir melnā kaste, kurā cilvēks tikai formāli apstiprina rezultātus — un tas nav tas pats.

Pastāv arī kumulatīvs ieguvums, kas bieži tiek nenovērtēts. Cilvēka atgriezeniskā saite kļūst visvērtīgākā, ja to uzskata par operacionāliem datiem: tā tiek iegūta, pārvaldīta un novirzīta atpakaļ pārtrenēšanas vai precizētās apmācības konveijeros, nevis glabāta nesaistītās rindās. Komandas, kas instrumentē pārskatītāju veiktos labojumus, laika gaitā redz modeļa veiktspējas uzlabošanos, ko neiegūst komandas, kuras paļaujas uz statiskām apmācības datu kopām.


Kur tiek izmantots HITL: piemēri no reālās pasaules

Šis modelis tiek izmantots dažādās nozarēs, taču cilvēka loma būtiski atšķiras atkarībā no jomas.

Radiologs pārskata MI atzīmētus medicīniskos attēlus

Medicīniskā attēldiagnostika. Radiologi pārskata MI atzīmētās anomālijas, pirms atradne nonāk pacienta medicīniskajā kartē. MI sašaurina meklēšanas lauku, bet galīgo lēmumu pieņem ārsts. Neviens no tiem atsevišķi nav tik uzticams kā abu kombinācija, turklāt Amerikas Savienoto Valstu normatīvie ietvari, tostarp FDA vadlīnijas par MI iespējotām medicīnas ierīcēm, daudzām diagnostikas lietojumprogrammām pieprasa dokumentētu cilvēka uzraudzību.

Satura moderēšana. Platformas izmanto klasifikatorus, lai atzīmētu potenciāli pārkāpjošu saturu, un pēc tam robežgadījumus novirza cilvēkiem. Klasifikators apstrādā apjomu, bet cilvēki — nianses, kontekstu un apelācijas. Izaicinājums ir tāds, ka pārskatītāju lēmumi paši kļūst par apmācības datiem, tāpēc nekonsekventa moderēšana rada nekonsekventus modeļus.

Klientu atbalsta aģenti. Tieši šeit MI un cilvēka sadarbība atbalsta procesos kļūst īpaši interesanta. Aģents, kas var sagatavot atbildes melnrakstu, ir noderīgs. Aģents, kas var arī nosūtīt atbildi, atjaunināt pasūtījumu vai izsniegt atmaksu, ir jaudīgs, taču riskants. Apstiprināšanas vārti pirms šīm ierakstīšanas darbībām ir atšķirība starp noderīgu rīku un saistību risku. Cilvēks pārskata ierosināto darbību, to apstiprina vai rediģē, un aģents to izpilda.

Krāpšanas izmeklēšana. Krāpšanas modeļi novērtē darījumus un atzīmē augsta riska darījumus. Cilvēks analītiķis pārskata atzīmētos gadījumus, pieņem galīgo lēmumu, un šis lēmums tiek izmantots modeļa uzlabošanai. Analītiķa nozares zināšanas palīdz pamanīt modeļa vēl neapgūtus modeļus.

Datu marķēšanas konveijeri. Šis ir sākotnējais HITL izmantošanas gadījums: pūļa marķētāji vai nozares eksperti anotē attēlus, tekstu vai audio, lai izveidotu uzraudzītas apmācības datu kopas. Tādi pakalpojumi kā Scale AI un Amazon Mechanical Turk šo procesu īsteno lielā mērogā, lai gan marķētāju kvalitātes kontrole ir būtisks operacionāls izaicinājums.

Profesionāļa padoms: Klientu atbalstā visvērtīgākais HITL brīdis nav atbildes melnraksta izveide, bet gan apstiprinājums pirms jebkuras darbības, kas maina konta stāvokli. Novirziet šādas darbības cilvēkam ikreiz neatkarīgi no modeļa pārliecības līmeņa.


Kā izstrādāt HITL sistēmu produkcijas videi?

Lai HITL produkcijas vidē darbotos pareizi, nepietiek tikai ar “pārskatīšanas” soļa pievienošanu. Arhitektūrai kā pirmās klases jautājumi jāapstrādā stāvokļa saglabāšana, pārskatītāju maršrutēšana, noildzes un atgriezeniskās saites iegūšana.

Noturīga izpilde un stāvokļa saglabāšana

Noturīga izpilde ir būtiska prasība pārtraucamu aģentu izstrādē. Sistēmām jāsaglabā izpildes grafiki un pēc cilvēka ievades jāatsāk to darbība, lai netiktu zaudēts konteksts, ja apstiprinājums aizņem stundas vai dienas. Testēšanai atmiņā saglabātāji darbojas labi. Produkcijas vidē izmantojiet noturīgus kontrolpunktu saglabātājus, piemēram, AsyncPostgresSaver vai MongoDBSaver. Ja sistēma avarē vai tiek restartēta laikā starp pārtraukumu un cilvēka lēmumu, aģenta stāvoklim ir jāizdzīvo.

Apstiprināšanas vārtu modeļi

Vārtu veids Kad izmantot Kompromiss
Apstiprināšana katram rīkam Augsta riska rīki (e-pasta nosūtīšana, rakstīšana datubāzē) Precīza kontrole; vairāk konfigurācijas darba
Globālais karodziņš Visi rīku izsaukumi sensitīvā aģentā Vienkārši aktivizēt; var pārslogot pārskatītājus
Nosacījums Kontrole pēc argumenta vērtības (piem., summas sliekšņa) Precīza atlase; nepieciešama nosacījumu loģika
Sakārtota pārtraukumu rinda Vairāki neapstrādāti apstiprinājumi vienā izpildē Saglabā izpildes secību; palielina aizkavi

Maršrutēšana un eskalācija

Iepriekš izlemiet, kas ko pārskata. Nozares eksperti maksā vairāk un viņiem ir mazāka pieejamā kapacitāte nekā vispārīga profila pārskatītājiem, tāpēc maršrutējiet atbilstoši. Nosakiet cilvēka atbildes SLA un definējiet alternatīvu rīcību, ja SLA netiek ievērots: vai aģents gaidīs neierobežoti ilgi, eskalēs jautājumu vecākam pārskatītājam vai veiks drošu noklusējuma darbību? Noildzes bez noteiktām alternatīvām ir biežs incidentu cēlonis produkcijas vidē.

Auditācijas žurnāli un pārskatītāja saskarne

Veidojiet pārskatītāja saskarni tā, lai tā radītu kvalitatīvus lēmumus, nevis tikai apstiprinājumus. Veidlapas ar ierobežotu izvēli (apstiprināt / rediģēt / noraidīt) rada tīrākus apmācības datus nekā brīva teksta komentāru lauki. Reģistrējiet katru lēmumu ar laika zīmogu, pārskatītāja ID un aģenta stāvokli pārtraukuma brīdī. Šis žurnāls vienlaikus ir gan jūsu auditācijas pēda, gan apmācības datu kopa.

Profesionāļa padoms: Uztveriet pārskatītāja saskarni kā datu vākšanas instrumentu. Katrs lauks, ko pievienojat lēmuma veidlapai, ir pazīme, ko varat izmantot nākamajā modeļa versijā. Izstrādājiet to pirms aģenta izveides, nevis pēc tam.

Arī komandām, kas īpaši veido čatbotu nodošanas cilvēkam plūsmas, piemērojami tie paši principi: saglabājiet sarunas stāvokli, novirziet to atbilstošajam aģenta līmenim un reģistrējiet nodošanas iemeslu.


HITL pret Human-on-the-Loop un Human-over-the-Loop

Šie trīs termini apzīmē patiešām atšķirīgus uzraudzības modeļus, un to jaukšana rada nepareizi piemērotus risinājumus.

Termins Laiks Cilvēka loma Vai bloķē izpildi? Vislabāk piemērots
Human-in-the-loop (HITL) Sinhrona Apstiprina vai rediģē pirms darbības Augstas nozīmes darbības ar ārējām sekām
Human-on-the-loop (HOTL) Asinhrona Uzrauga un var iejaukties Liela apjoma, zemāka riska rezultāti
Human-over-the-loop (HOverT) Stratēģiska Nosaka politiku, auditē rezultātus Pārvaldība, regulētas sistēmas

Pasīva uzraudzība (HOTL) būtiski atšķiras no sinhronas kontroles ar vārtiem (HITL). Izstrādātājiem uzraudzības modelis jāpielāgo riskiem un caurlaidībai. Hibrīdas sistēmas bieži apvieno vairākas pieejas: HITL rakstīšanas darbībām, HOTL tikai lasāmiem rezultātiem un HOverT politikai un modeļa pārvaldībai.

Stanford HAI un nozares eksperti iesaka cilvēkus uztvert kā lēmumu pieņēmējus — šo pieeju dažkārt dēvē par “cilvēki ir atbildīgie” — nevis vienkārši ievietot cilvēkus datu konveijerā. Šī atšķirība novirza izstrādes prioritātes uz auditējamību un cilvēku darbplūsmām, nevis uz cilvēka iesaistes punktu skaita samazināšanu. MI, kas darbojas kā asistents, kamēr galīgā vara paliek cilvēkam, ir cita sistēmas arhitektūra nekā tāda, kur cilvēki ir tikai vēl viens datu avots.

Norādījumi modeļa izvēlei:

  • Augstas likmes + neatgriezeniskas darbības: vienmēr HITL
  • Liels apjoms + atgriezeniski rezultāti: HOTL ar eskalācijas ceļiem
  • Regulēta nozare + valdes līmeņa atbildība: HOverT pārvaldībai, HITL konkrētām lēmumu klasēm
  • Zems risks + augsta pārliecība: apsveriet cilvēka pārskatīšanas pilnīgu noņemšanu, saglabājot uzraudzību

Kādi ir faktiskie izaicinājumi, ieviešot HITL lielā mērogā?

HITL izmaksas ir reālas, un projektēšanas posmā tās bieži tiek novērtētas par zemu.

Mērogojamība. Sinhronie apstiprināšanas vārti palielina aizkavi un prasa cilvēku kapacitāti. Pieaugot apjomam, pārskatītāju rinda kļūst par šauro vietu. Risinājums ir uz riskiem balstīta maršrutēšana: eskalējiet tikai lēmumus ar lielu ietekmi, zemu pārliecību vai regulējuma prasībām, izmantojot pārliecības sliekšņus un riska vērtēšanu. Ja visu novirza cilvēkiem, automatizācijas jēga tiek zaudēta.

Aizspriedumu pastiprināšana. Tas ir smalkāks risks. Modelis, kas apmācīts ar cilvēku labojumiem, pārņem cilvēku aizspriedumus. Vēl sliktāk — labi saskaņots modelis var šos aizspriedumus pastiprināt lielā mērogā. Spriedze starp saskaņošanu un papildināmību šeit ir būtiska: perfekti saskaņots modelis var nostiprināt cilvēku kļūdas, savukārt papildinošs modelis, kas izmanto atšķirīgas stiprās puses, var sniegt labākus rezultātus nekā katrs no tiem atsevišķi. Operacionālie risinājumi ietver pārskatītāju dažādību, kalibrēšanas apmācības un starpnovērtētāju uzticamības pārbaudes.

Privātums un datu pārvaldība. Cilvēki, kas veic pārskatīšanu, redz reālus datus. Klientu atbalstā, krāpšanas atklāšanā un veselības aprūpē šie dati bieži ietver personas datus. Izveidojiet datu minimizēšanas politiku: rediģējiet vai pseidonimizējiet laukus, kas pārskatītājiem nav jāredz. Definējiet pārskatītāju lēmumu un datu, uz kuriem tie balstīti, glabāšanas termiņus.

Cilvēku nogurums un nekonsekvence. Pārskatītājiem, kas dienā pieņem simtiem lēmumu, mainās kritēriji. Lēmumu kvalitāte pasliktinās. Risinājumi ietver:

  1. Ierobežojiet katra pārskatītāja dienas pārskatīšanas apjomu līdz pamatotam slieksnim, kas balstīts uz uzdevuma sarežģītību
  2. Regulāri rīkojiet kalibrēšanas sesijas, kurās pārskatītāji novērtē vienus un tos pašus gadījumus un salīdzina rezultātus
  3. Izsekojiet starpnovērtētāju uzticamību (Kohenna kappa vai līdzīgs rādītājs) kā operacionālu metriku
  4. Mainiet pārskatītājus starp uzdevumu veidiem, lai novērstu redzesloka sašaurināšanos
  5. Ieviesiet obligātus pārtraukumus un atzīmējiet pārskatītājus, kuru apstiprinājumu īpatsvars būtiski atšķiras no sākotnējā līmeņa

Izmaksas. Cilvēka veiktā pārskatīšana ir dārga. HITL biznesa pamatojums ir atkarīgs no novērsto kļūdu izmaksām salīdzinājumā ar pārskatītāja laika izmaksām. Pirms sinhronu vārtu ieviešanas katrai darbībai šo attiecību skaidri aprēķiniet.


Praktisks kontrolsaraksts HITL sistēmu ieviešanai

Pirms HITL sistēmas ieviešanas izpildiet šos soļus norādītajā secībā.

  1. Riska novērtējums. Kartējiet katru darbību, ko aģents var veikt. Klasificējiet tās pēc atgriezeniskuma un ietekmes. Kontrolējiet tikai darbības ar lielu ietekmi, kuras ir grūti atsaukt.
  2. Pārskatītāju definēšana. Nosakiet, kas ko pārskata. Nozares eksperts, vispārīga profila pārskatītājs vai pakāpeniska eskalācija? Definējiet piekļuvi, SLA un alternatīvo rīcību.
  3. Saskarnes izstrāde. Izveidojiet ierobežotas izvēles lēmumu veidlapas pirms aģenta izveides. Izlemiet, kādi strukturētās atbildes veidi nepieciešami (apstiprināt / rediģēt / noraidīt / atbildēt) un kādi metadati jāiegūst.
  4. Saglabāšanas stratēģija. Izvēlieties noturīgu kontrolpunktu saglabātāju produkcijas videi. Pirms palaišanas atsevišķi pārbaudiet stāvokļa atjaunošanu.
  5. Atgriezeniskās saites iegūšana. Jau no pirmās dienas iekļaujiet pārskatītāju lēmumus pārvaldītā datu konveijerā. Nesaistītas rindas nozīmē, ka maksājat par cilvēka pārskatīšanu, negūstot modeļa uzlabošanas ieguvumu.
  6. Pārvaldība. Nosakiet, kas atbild par pārskatītāju komandu, kas auditē lēmumu žurnālus un kam ir tiesības mainīt maršrutēšanas noteikumus.

Svarīgākās metrikas, ko izsekot pēc palaišanas:

  • Pārskatīšanas īpatsvars: to aģenta darbību procentuālā daļa, kas aktivizē cilvēka iesaistes pārtraukumu
  • Laiks līdz lēmumam: mediāna un 95. procentile no pārtraukuma līdz cilvēka lēmumam
  • Apstiprinājumu attiecība: cik liela daļa pārtrauktu darbību tiek apstiprināta bez izmaiņām salīdzinājumā ar rediģētām vai noraidītām
  • Modeļa uzlabošanās ātrums: kā pārskatītāju labojumi laika gaitā maina modeļa veiktspēju
  • Starpnovērtētāju uzticamība: lēmumu konsekvence starp pārskatītājiem, vērtējot vienādas ievades

Kad samazināt cilvēka pārskatīšanas apjomu: veiciet kontrolētus eksperimentus, izmantojot pārliecības sliekšņus. Ja darbībām, kuru pārliecības rādītājs pārsniedz noteiktu līmeni, ilgākā periodā ir gandrīz nulle labojumu vai noraidījumu, šis slieksnis var būt automatizācijas kandidāts. Pazeminiet to pakāpeniski un uzraugiet novirzes.


Ko pašreizējie pētījumi saka par HITL nākotni?

Interesantākais darbs, kas pašlaik notiek, nav saistīts ar vēl vairāk cilvēku pievienošanu cilpai. Tas ir par cilvēka iesaistes punktu padarīšanu viedāku.

Pētījumi par adaptīviem ansambļiem rāda, ka maršrutēšana starp saskaņotiem un papildinošiem modeļiem atkarībā no konteksta var uzlabot cilvēka un MI komandas rezultātus, pārsniedzot to, ko katrs modelis spēj sasniegt atsevišķi. Atziņa ir tāda, ka jūs ne vienmēr vēlaties, lai MI piekristu cilvēkam. Dažkārt vēlaties, lai tas pamana to, ko cilvēks neierauga, un tam nepieciešama cita modeļa arhitektūra nekā tikai saskaņošana.

Stanford HAI pieeja “cilvēki ir atbildīgie” gūst popularitāti gan politikas veidotāju, gan inženieru vidū. Tā pārformulē jautājumu no “kā samazināt cilvēka iesaisti?” uz “kā padarīt cilvēka varu nozīmīgu un auditējamu?” Šai pārejai ir reālas arhitektūras sekas: prioritāte tiek piešķirta lēmumu reģistrēšanai, pārskatītāju darbplūsmām un eskalācijas ceļiem, nevis caurlaidības optimizācijai.

Praktiskie izpildes laika modeļi, kas nostiprinās 2025. un 2026. gadā, ietver:

  • Uz pārtraukumiem balstītus apstiprināšanas vārtus ar noturīgu izpildi kā noklusējuma arhitektūru jebkuram aģentam, kas var veikt darbības ar ārējām sekām
  • Strukturētas cilvēka atbildes veidlapas, kas ierobežo pārskatītāju izvēli un rada tīrus apmācības datus
  • Uz pārliecību balstītu maršrutēšanu, kas dinamiski pielāgo, kurām darbībām nepieciešama cilvēka pārskatīšana, pamatojoties uz modeļa pārliecību un vēsturiskajiem apstiprinājumu rādītājiem
  • Ansambļus, kas apzinās papildināmību un novirza uz dažādiem modeļa variantiem atkarībā no tā, vai uzdevumam noder saskaņošana vai neatkarīgs spriedums

Viens eksperiments, ko vērts veikt: paņemiet pašreizējo apstiprinājumu rindu un analizējiet rediģēšanas un noraidījumu īpatsvaru pēc rīka veida un pārliecības diapazona. Gandrīz vienmēr redzams, ka neliela rīku izsaukumu daļa rada lielāko daļu labojumu. Tieši tur jūsu ieguldījums HITL patiešām atmaksājas, un parasti tā nav vieta, ko gaidījāt.

Profesionāļa padoms: Izsekojiet apstiprinājumu attiecībai pa pārliecības decilēm. Ja augstākajā pārliecības grupā apstiprinājumu īpatsvars ir gandrīz 100%, jūs maksājat par nevajadzīgu cilvēka pārskatīšanu. Ja zemākajā grupā noraidījumu īpatsvars ir gandrīz 100%, jūsu modelim nepieciešama pārtrenēšana, nevis vairāk pārskatītāju.

Varat izpētīt, kā Interval AI pieiet cilvēka sprieduma apvienošanai ar aģentu izpildvidēm komandām, kas veido HITL darbplūsmas produkcijas videi.


Galvenie secinājumi

MI ar cilvēku iesaisti vislielāko vērtību sniedz tad, ja cilvēka spriedums ir iebūvēts izpildes laika apstiprināšanas vārtos darbībām ar ārējām sekām, nevis tikai apmācības konveijeros, un ja pārskatītāju lēmumi tiek iegūti kā pārvaldīti dati, kas veicina modeļa uzlabošanu.

Punkts Sīkāka informācija
HITL ir izpildes laika modelis, nevis tikai apmācības tehnika Apstiprināšanas vārti pirms aģenta darbībām ar ārējām sekām tagad ir pamatprasība produkcijas ieviešanās.
Uz riskiem balstīta maršrutēšana ļauj HITL mērogot Sinhronu cilvēka pārskatīšanu rezervējiet lēmumiem ar lielu ietekmi, zemu pārliecību vai regulējuma prasībām, izmantojot pārliecības sliekšņus.
Noturīga izpilde nav apspriežama Produkcijas sistēmām jāsaglabā aģenta stāvoklis starp pārtraukumiem; atmiņā saglabātāji neiztur, ja apstiprinājumi aizņem stundas vai dienas.
Cilvēki pie varas ir labāk nekā cilvēki konveijerā Izstrāde, kas balstīta uz cilvēka varu un auditējamību, rada labākus rezultātus nekā cilvēka iesaistes punktu samazināšana.
Deskhero HITL īsteno sākotnēji Deskhero MI sagatavo atbilžu melnrakstus un nodod sarunu cilvēkiem, ja nav pārliecināts, turklāt katra automatizētā darbība tiek marķēta un reģistrēta.

Ko lielākā daļa komandu par HITL saprot nepareizi

Pastāv HITL ieviešanas veids, kas no ārpuses izskatās pareizs, bet iekšēji klusi izgāžas. Komanda pievieno pārskatīšanas soli, pārskatītāji, rūpīgi neizlasot rezultātus, 95% no tiem apstiprina, un organizācija pasludina sistēmu par “cilvēka uzraudzītu”. Auditācijas pēda pastāv. Pārvaldības kontrolsaraksta punkts ir atzīmēts. Modelis nekad neuzlabojas, jo atgriezeniskā saite ir troksnis.

Šī kļūme rodas, ja HITL uztver kā atbildības aizsargu, nevis mācīšanās mehānismu. Apstiprināšanas vārti ir paredzēti kļūdu uztveršanai, taču to dziļākais mērķis ir radīt strukturētus, pārvaldītus datus par to, kur modelis kļūdās un kāpēc. Komandas, kas to saprot, veido pārskatītāju saskarnes, kurās tiek fiksēts kāpēc darbība tika rediģēta, nevis tikai tas, ka tā tika rediģēta. Tās seko starpnovērtētāju uzticamībai. Tās rīko kalibrēšanas sesijas. Tās uztver pārskatītāju komandu kā datu kvalitātes, nevis darbinieku skaita problēmu.

Otrs nepietiekami novērtētais aspekts ir pieeja “cilvēki ir atbildīgie”. Lielākā daļa HITL ieviešanu ir izstrādātas tā, lai laika gaitā samazinātu cilvēka iesaisti, kas ir saprātīgs efektivitātes mērķis. Tomēr augstas nozīmes jomās mērķim vajadzētu būt cilvēka varas padarīšanai nozīmīgākai sistēmai nobriestot, nevis tās klātbūtnes samazināšanai. Tas nozīmē labākus rīkus pārskatītājiem, skaidrākus eskalācijas ceļus un pārvaldības struktūras, kas cilvēkiem piešķir reālu varu mainīt modeļa uzvedību, nevis tikai apstiprināt atsevišķus rezultātus.

Komandas, kas no HITL iegūst visvairāk, uztver to kā organizācijas spēju, nevis tehnisku funkciju. Tehnoloģija ir vieglākā daļa.


Deskhero izvirza cilvēka uzraudzību MI atbalsta centrā

Ja šajā rakstā iekļautais kontrolsaraksts raksturo labu HITL, Deskhero klientu atbalsta komandām ir veidots tieši uz šo principu pamata. MI sagatavo atbilžu melnrakstus un lasa pielikumus, taču nekas netiek automātiski nosūtīts, ja vien jūs to neesat aktivizējis. Katra automatizētā darbība tiek marķēta un reģistrēta. MI nodod sarunu cilvēkam, tiklīdz rodas neskaidrība, tāpēc tas nekad neizdomā atbildi.

Deskhero

Zināšanu bāze aug tikai no satura, ko jūsu komanda ir apstiprinājusi: atrisinātās biļetes un jūsu vietnes lapas kļūst par BUJ ierakstiem, kurus MI var izmantot, taču tikai pēc aģenta apstiprinājuma. Šie apstiprināšanas vārti praksē ir HITL, nevis tikai teorijā. E-komercijas komandām Shopify AI support integrācija saglabā cilvēka kontroli pār konta un pasūtījumu izmaiņām tieši tāpēc, ka tās ir svarīgākās darbības ar ārējām sekām.

Deskhero darbojas Gmail, Google Workspace vai Microsoft 365 vidē bez migrācijas. Sāciet 30 dienu bezmaksas izmēģinājumu, kredītkarte nav nepieciešama, un uzziniet, kā praksē darbojas uz HITL balstīts palīdzības dienests.


Noderīgi avoti

Tālāk minētie avoti sakārtoti vispirms pēc praktiskās, pēc tam pēc pētnieciskās vērtības. Ja veidojat sistēmu, sāciet ar dokumentāciju un nozares rakstiem; teorētiskajam pamatojumam pievērsieties akadēmiskajiem pētījumiem.

Avots Ko tas aptver
LangChain HITL dokumentācija Pārtraukumu mehānika, lēmumu veidi, saglabāšanas modeļi un apstiprināšanas konfigurācija katram rīkam
inference.sh HITL izpildvides dokumentācija Apstiprināšanas vārtu konfigurācija ar vienu karodziņu, noturīga izpilde un prasības datu saglabāšanai produkcijas vidē
Databricks HITL emuārs Uz riskiem balstīta maršrutēšana, atgriezeniskā saite kā operacionāli dati un HITL un HOTL kompromisi
IBM: Kas ir human-in-the-loop? Uzņēmumu pieeja, aģentu darbību ar ārējām sekām riski un ieviešanas modeļi
Stanford HAI: Kas ir human-in-the-loop? Pieeja “cilvēki ir atbildīgie”, politikas veidošana un uzraudzības izstrādes principi
Stanford HAI: Humans in the Loop — Design of Interactive AI Systems Pētījumu pārskats par interaktīvu MI sistēmu izstrādi un cilvēka un MI sadarbības modeļiem
AAAI: Align When They Want, Complement When They Need Pētījumi par papildināmību un saskaņošanu, adaptīvu ansambļu maršrutēšanu un cilvēka un MI komandas veiktspēju
MIT HDSR: Data Science and Engineering With Human in the Loop Akadēmisks HITL skatījums datu konveijeros, anotēšanas kvalitātē un atgriezeniskās saites cilpās
NCBI/PMC: HITL in clinical AI HITL uzraudzības izmantošana medicīniskajā attēldiagnostikā un klīnisko lēmumu atbalstā

BUJ

Ko MI nozīmē human-in-the-loop?

MI ar cilvēku iesaisti ir sistēmas izstrādes modelis, kurā cilvēks ir integrēts MI lēmumu pieņemšanas vai izpildes ciklā — lai marķētu apmācības datus, novērtētu rezultātus vai apstiprinātu aģenta darbības pirms to īstenošanas. Noteicošā iezīme ir tā, ka sistēma noteiktā kontrolpunktā gaida cilvēka ievadi vai to ņem vērā, nevis darbojas pilnībā autonomi.

Kāda ir atšķirība starp human-in-the-loop un human-on-the-loop?

Human-in-the-loop (HITL) izmanto sinhronus apstiprināšanas vārtus, kas aptur aģenta izpildi, līdz cilvēks pieņem lēmumu; human-on-the-loop (HOTL) ļauj sistēmai darboties autonomi, kamēr cilvēks to uzrauga un var asinhroni iejaukties. HITL ir piemērots augstas nozīmes, neatgriezeniskām darbībām; HOTL — liela apjoma un zemāka riska rezultātiem, kad izpildes bloķēšana reāllaikā būtu nepraktiska.

Ko human-in-the-loop nozīmē MI aģentiem?

MI aģentiem, kas var veikt darbības ar ārējām sekām (nosūtīt e-pastus, atjaunināt ierakstus, apstrādāt darījumus), HITL nozīmē apstiprināšanas vārtu ievietošanu pirms šo darbību izpildes. Aģents apstājas, parāda cilvēkam ierosināto darbību un atsāk darbu tikai pēc lēmuma to apstiprināt, rediģēt vai noraidīt, turklāt aģenta stāvoklis tiek saglabāts visā procesa laikā.

Ko MI nozīmē human-on-the-loop?

Human-on-the-loop ir uzraudzības modelis, kurā MI sistēma darbojas autonomi, bet cilvēks uzrauga rezultātus vai žurnālus un iejaucas, lai labotu vai atceltu darbību, ja kaut kas noiet greizi. Atšķirībā no HITL tas nebloķē izpildi, tāpēc ir piemērotāks liela caurlaidības apjoma scenārijiem, kuros sinhrona pārskatīšana radītu nepieņemamu aizkavi.

Kā Deskhero īsteno MI ar cilvēku iesaisti atbalsta komandām?

Deskhero MI sagatavo atbilžu melnrakstus un darbojas tērzēšanas robotā, taču vienmēr nodod sarunu cilvēkam, ja nav pārliecināts, un nekad neko automātiski nenosūta, ja vien komanda to nav aktivizējusi. Katra automatizētā darbība tiek marķēta un reģistrēta, savukārt zināšanu bāze izmanto tikai saturu, ko aģents ir skaidri apstiprinājis, tādējādi cilvēki saglabā varu pār to, ko MI drīkst teikt.