Agentsete süsteemide hindamine: AI-agentide testimine ja kvaliteedi hindamine


Teave sellel koolitusel toimuva õppe kohta.

Koolituse eesmärk: anda praktilised oskused AI-agentide hindamiseks, testimiseks ja seireks — alates jälgitavusest (observability) ja trajektooride jälgimisest, läbi hindamiskomplektide ehitamise (koodipõhised kontrollid, LLM-as-a-judge, käsitsi ekspertiis) ja verifitseeritavate ülesannete ning testkeskkondade disaini, kuni avalike benchmarkide, agentide red teaming'i ja tootmisseireni.

Õpe toimub Tallinna kesklinnas (Tartu mnt 18) ja/või online. Õppematerjalid on hinna sees. Vajadusel antakse õppeperioodiks sülearvuti.

NB! Käesolev koolitus toimub ainult inglise keeles (õppematerjalid ja suhtlus on inglise keeles).

Sellele koolitusele on saadaval erinevad rahastusvõimalused, sealhulgas riikliku toetuse ja mittetulundusühingute programmid. Täpsema info saamiseks võtke ühendust meie konsultandiga.

Uuri toetusmeetmete kohta →


Sihtgrupp:

Koolitus sobib teile, kui te:

  • olete QA / testide automatiseerimise insener ja soovite omandada kvaliteedi tagamise kiireimini kasvava eriala — AI-agentide hindamise;
  • olete tarkvaraarendaja ja ehitate (või plaanite ehitada) LLM- ja agentfunktsioone ning peate oskama nende kvaliteeti mõõta;
  • olete andme- või ML-spetsialist ja liigute rakendusliku AI-hindamise ja LLMOps'i suunas;
  • olete IT-spetsialist Eestis või ELis ja otsite kaugtööd võimaldavat tööd — AI-hindamisplatvormid palkavad üle maailma ja hindavad selle koolituse oskusi;
  • olete tootejuht või analüütik AI-tootes ja vajate süsteemset viisi hinnata, kas teie agendid tegelikult töötavad;
  • juba töötate AI-hindamisplatvormidel (märgendamine, vastuste hindamine) ja soovite liikuda agentide hindamise inseneritasemele.

Koolitusel omandatavad võtmeoskused:

  • Mõista agentide arhitektuuri: planeerimistsüklid, tööriistad, mälu, MCP
  • Kasutada koodiagente (Claude Code, Cursor) igapäevase töövahendina
  • Instrumenteerida agente jälgimisega (OpenTelemetry, Arize Phoenix, LangSmith)
  • Koostada golden-andmestikke ja viia läbi struktureeritud eksperimente
  • Disainida ja valideerida LLM-as-a-judge hindajaid
  • Hinnata agentide trajektoore, tööriistade valikut ja koondumist
  • Disainida verifitseeritavaid ülesandeid ja testkeskkondi agentidele
  • Käivitada agente avalikel benchmarkidel (GAIA, SWE-bench) ja tõlgendada tulemusi
  • Teha agentide red teaming'ut: ohtlikud otseteed, tööriistade väärkasutus, prompt injection
  • Seirata agente tootmises: online-hindamised, regressioonid, kulu ja latentsus

Nõuded õppijatele:

  • kindel arvutikasutaja
  • inglise keele oskus tehnilise õppe jälgimiseks (umbes B1/B2) — koolitus toimub inglise keeles
  • Pythoni baasoskused on tungivalt soovitatavad (range eeltingimus puudub: praktilised tööd tulevad valmis mallidega ja on tehtavad AI-koodiassistentide abil)
  • soovitatav on omada isiklikku sülearvutit (Windows / Mac / Linux, RAM 8 GB+), vajadusel antakse õppeperioodiks sülearvuti.

Õpiväljundid:

Antud koolituse läbinud:

  • selgitavad agentsete AI-süsteemide arhitektuuri ja tüüpilisi tõrkerežiime;
  • instrumenteerivad ja jälgivad agente, loevad ja analüüsivad agentide trajektoore;
  • ehitavad hindamiskomplekte, mis ühendavad koodipõhised kontrollid, LLM-as-a-judge ja käsitsi ekspertiisi;
  • disainivad verifitseeritavaid ülesandeid ja testkeskkondi koos vastuvõtutestidega;
  • käivitavad ja tõlgendavad benchmark-hindamisi ning haldavad regressioonikomplekte;
  • teevad agentide baastaseme red teaming'ut ja koostavad kvaliteedi- ja haavatavusraporteid.

Õppemeetodid:

Koolituse üldmaht: 80 akadeemilist tundi, millest 40 akadeemilist tundi toimub auditoorselt (kontakttöö õppejõuga: loengud, praktilised tööd, seminarid) ja 40 akadeemilist tundi on iseseisev töö.

Õpitulemuste hindamiskriteeriumid:

Õpitulemusi hinnatakse iseseisvalt tehtud praktiliste tööde ja lõpuprojekti alusel (täielik hindamis-harness AI-agendile).

Hindamismeetodid:

Edukalt sooritatud praktilised ja kodutööd saavad hindeks „arvestatud".

Koolituse lõpetamise tingimused:

Koolituse edukaks lõpetamiseks ja tunnistuse saamiseks on vajalik saada „arvestatud" 75% kodutöödest ja kaitsta lõpuprojekt.

Lisainformatsioon:

Õppekavarühm: 0613 - Tarkvara ja rakenduste arendus ning analüüs õppekavarühm
Õppe korraldamise põhireeglid
Õppeprotsessi kvaliteedi tagamise põhireeglid

Koolituse programm

Moodul Mooduli põhiteemad Kestus
1. Agentsed süsteemid ja hindaja tööriistakomplekt
  • Agendi anatoomia: planeerimistsükkel (ReAct), router, tööriistad, mälu; MCP
  • Vestlusrobotid vs RAG vs agendid; kus agendid eksivad: hallutsineeritud tegevused, tsüklid, ohtlikud otseteed
  • Miks agentide hindamine erineb tarkvara testimisest ja LLM-ide hindamisest
  • Koodiagendid (Claude Code, Cursor) kui hindaja igapäevased tööriistad
  • 4 ak. t.
    2. Jälgitavus ja jälgimine (observability & tracing)
  • Jäljed (traces) ja spannid; OpenTelemetry instrumenteerimine
  • Arize Phoenix ja LangSmith / Langfuse — agendi käivituste lugemine
  • Tokenite, kulu ja latentsuse seire
  • Praktika: töötava agendi instrumenteerimine ja analüüs
  • 4 ak. t.
    3. Hindajad I: andmestikud ja kohtunikud
  • Kolm hindaja tüüpi: koodipõhine, LLM-as-a-judge, käsitsi ekspertiis
  • Golden-andmestikud ja struktureeritud eksperimendid
  • Kohtunik-promptide disain ja valideerimine
  • Praktika: hindamiskomplekti ehitamine demo-agendile
  • 4 ak. t.
    4. Hindajad II: trajektoorid ja tõrgete analüüs
  • Router'i ja tööriistavaliku hindamine
  • Trajektoori hindamine ja koondumise mõõtmine
  • Tõrkerežiimide taksonoomia ja veaanalüüs
  • Praktika: toorjälgedest prioritiseeritud defektiraportini
  • 4 ak. t.
    5. Keskkonnad ja ülesannete disain
  • Realistlikud testkeskkonnad: koodibaas, taristu, kontekst („virtuaalne ettevõte")
  • Verifitseeritavate ülesannete disain keskkonna vaheseisunditest
  • Vastuvõtutestid: aktsepteeri iga korrektne lahendus, lükka tagasi ebakorrektsed
  • Terminaltingimused, korratavus ja hindamisprotokollide õiglus
  • Praktika: hindamisülesande ehitamine ja ülevaatus algusest lõpuni
  • 8 ak. t.
    6. Benchmargid
  • Avalikud agentide benchmargid: GAIA, SWE-bench Verified, tau-bench
  • Usaldusväärsuse mõõdikud: pass@k ja pass^k; mittedeterminism
  • Omad valdkonnaspetsiifilised benchmargid — millal ja kuidas neid ehitada
  • Praktika: agendi käivitamine GAIA alamhulgal ja tulemuse tõlgendamine
  • 4 ak. t.
    7. Agentide turvalisus ja red teaming
  • Ohtlikud otseteed: hea eesmärk, ohtlik tee; ülesande piiridest väljumine
  • Tööriistade väärkasutus ja prompt injection tööriistade kaudu
  • Guardrails ja järelevaataja-mudelid; EU AI Act vaade
  • Praktika: demo-agendi red teaming ja haavatavusraport
  • 4 ak. t.
    8. Tootmisseire
  • Online-hindamised ja kasutajate tagasiside tsüklid
  • Regressioonikomplektid ja CI integratsioon
  • Kulu / latentsuse eelarved; kvaliteedi dashboard'id
  • Praktika: hindamiste sidumine CI-torusse
  • 4 ak. t.
    9. Lõpuprojekt
  • Täielik hindamis-harness AI-agendile
  • Rubriik + automaathindamised + red-team läbimäng + raport
  • Lõpuprojekti kaitsmine
  • 4 ak. t.

    Teave koolituse kohta

    Toimumisaeg:
    29.09.2026 - 24.11.2026
    27.10.2026 - 22.12.2026
    24.11.2026 - 19.01.2027

    Tähelepanu! Käesolev koolitus toimub ainult inglise keeles.

    Ajakava:
    T, N 17:45 - 21:00 (õhtune grupp)
    Registreeru koolitusele →Vastame 1 tööpäeva jooksul
    Koolituse kestus: 8 nädalat

    Õppeformaat ja toimumiskoht:
    Aadress: Tartu mnt. 18, Tallinn / Online.
    Gamma Intelligence Training Centre
    Koolitus toimub auditoorses formaadis (kuni 12 inimest klassis) ja/või online (Zoom / Microsoft Teams); grupi kogusuurus kuni 18 inimest.

    Õppekeel: inglise

    Maksumus: 2500 EUR (KM 24% sisaldub)

    Koolituse üldmaht: 80 ak. t. (40 auditoorset + 40 iseseisvat)
    Formaat: loengud + praktilised tööd + iseseisev töö.

    Õppejõud

    Nikolai Zubrilov

    Kvalifikatsioon: Python-arendaja ja Data Scientist; AI/LLM-arendaja ettevõttes Mentastic; Dataocean Analytics OÜ omanik; kommertskogemus backend-arenduses, andmeanalüüsis ja AI/LLM-is.

    Spetsialiseerumine: Python, AI/LLM-arendus, andmeanalüüs ja data science (Pandas, NumPy, Scikit-Learn), SQL (PostgreSQL / MySQL), REST API (FastAPI / Flask), automatiseerimine.

    Õpetamiskogemus: Python-i, andmeanalüüsi ja LLM-testimise koolituste õppejõud Gamma Intelligence Training Centre'is.

    Haridus: magistrikraad — arvuti- ja süsteemitehnika.

    Tutvuda CV-ga