Оценка агентных систем: тестирование и оценка качества AI-агентов


Информация об обучении на данном курсе

Цель курса: дать практические навыки оценки, тестирования и мониторинга AI-агентов — от трассировки и наблюдаемости (observability), через построение наборов оценок (проверки на коде, LLM-as-a-judge, ручная экспертиза) и проектирование верифицируемых задач и тестовых сред, до публичных бенчмарков, red teaming агентов и мониторинга в продакшене.

Обучение проходит в центре Таллинна (Tartu mnt. 18, Tallinn) и/или онлайн. В цену курса включены все учебные материалы. При необходимости на время обучения выдаётся ноутбук.


Целевая группа:

Курс актуален, если Вы:

  • QA / инженер по автоматизации тестирования и хотите добавить самую быстрорастущую специализацию в обеспечении качества — оценку AI-агентов;
  • разработчик ПО и создаёте (или планируете) LLM- и агентные функции, и вам нужно уметь измерять их качество;
  • специалист по данным / ML и движетесь в сторону прикладной оценки AI и LLMOps;
  • IT-специалист в Эстонии или ЕС и ищете работу с возможностью удалёнки — платформы оценки AI нанимают по всему миру и ценят навыки этого курса;
  • продакт-менеджер или аналитик AI-продукта и вам нужен системный способ понять, действительно ли ваши агенты работают;
  • уже работаете на платформах оценки AI (разметка, оценка ответов) и хотите перейти к инженерному уровню оценки агентов.

Ключевые навыки, которые вы получите на курсе:

  • Разбираться в архитектуре агентов: циклы планирования, инструменты, память, MCP
  • Использовать кодинг-агентов (Claude Code, Cursor) как повседневный рабочий инструмент
  • Инструментировать агентов трассировкой (OpenTelemetry, Arize Phoenix, LangSmith)
  • Собирать golden-датасеты и проводить структурированные эксперименты
  • Проектировать и валидировать оценщики LLM-as-a-judge
  • Оценивать траектории агентов, выбор инструментов и сходимость
  • Проектировать верифицируемые задачи и тестовые среды для агентов
  • Запускать агентов на публичных бенчмарках (GAIA, SWE-bench) и интерпретировать результаты
  • Проводить red teaming агентов: небезопасные обходные пути, злоупотребление инструментами, prompt injection
  • Мониторить агентов в продакшене: онлайн-оценки, регрессии, стоимость и задержки

Требования к обучающимся:

  • уверенный пользователь ПК
  • английский, достаточный для технического обучения (ориентировочно B1/B2)
  • базовые навыки Python настоятельно рекомендуются (жёсткого требования нет: практические работы идут с готовыми шаблонами и выполнимы с помощью AI-ассистентов для кода)
  • желательно наличие собственного ноутбука (Windows / Mac / Linux, RAM 8 GB+), при необходимости на время обучения выдаётся ноутбук.

Результат обучения:

Окончившие данный курс:

  • объясняют архитектуру и типовые режимы отказа агентных AI-систем
  • инструментируют и трассируют агентов, читают и анализируют траектории агентов
  • строят наборы оценок, сочетающие проверки на коде, LLM-as-a-judge и ручную экспертизу
  • проектируют верифицируемые задачи и тестовые среды с приёмочными тестами
  • запускают и интерпретируют оценки на бенчмарках, поддерживают регрессионные наборы
  • проводят базовый red teaming агентов и составляют отчёты о качестве и уязвимостях

Методы обучения:

Общий объём курса: 80 академических часов, из которых 40 академических часов проходят в аудитории (контактная работа с преподавателем: лекции, практические занятия, семинары) и 40 ак. часов — самостоятельная работа.

Критерии оценки результатов обучения:

Результаты обучения оцениваются на основе самостоятельно выполненных практических работ и итогового проекта (полноценный оценочный harness для AI-агента).

Методы оценки:

При успешном выполнении практические и домашние работы получают оценку «зачёт».

Условия окончания курса:

Для успешного окончания курса и получения сертификата необходимо получить зачёт по 75% домашних работ и защитить итоговый проект.

Дополнительная информация:

Группа учебной программы: 0613 - Разработка и анализ программного обеспечения (0613 - Tarkvara ja rakenduste arendus ning analüüs)
Основные правила организации обучения (на эстонском языке)
Основные правила обеспечения качества учебного процесса (на эстонском языке)

Программа курса

Модуль Основные темы модуля Объём
1. Агентные системы и инструментарий оценщика
  • Анатомия агента: цикл планирования (ReAct), маршрутизатор, инструменты, память; MCP
  • Чат-боты vs RAG vs агенты; где агенты ошибаются: галлюцинации действий, зацикливания, небезопасные обходные пути
  • Почему оценка агентов отличается от тестирования ПО и от оценки LLM
  • Кодинг-агенты (Claude Code, Cursor) как повседневный инструмент оценщика
  • 4 ак. ч.
    2. Наблюдаемость и трассировка
  • Трейсы и спаны; инструментирование OpenTelemetry
  • Arize Phoenix и LangSmith / Langfuse — чтение прогонов агента
  • Мониторинг токенов, стоимости и задержек
  • Практика: инструментирование и разбор рабочего агента
  • 4 ак. ч.
    3. Оценщики I: датасеты и судьи
  • Три типа оценщиков: на коде, LLM-as-a-judge, ручная экспертиза
  • Golden-датасеты и структурированные эксперименты
  • Проектирование и валидация промптов-судей
  • Практика: сборка набора оценок для демо-агента
  • 4 ак. ч.
    4. Оценщики II: траектории и анализ отказов
  • Оценка маршрутизатора и выбора инструментов
  • Оценка траектории и оценка сходимости
  • Таксономия режимов отказа и анализ ошибок
  • Практика: от сырых трейсов к приоритизированному отчёту о дефектах
  • 4 ак. ч.
    5. Среды и дизайн задач
  • Реалистичные тестовые среды: кодовая база, инфраструктура, контекст («виртуальная компания»)
  • Проектирование верифицируемых задач из промежуточных состояний среды
  • Приёмочные тесты: принимать любое корректное решение, отклонять некорректные
  • Терминальные условия, воспроизводимость и честность протоколов оценки
  • Практика: сборка и ревью оценочной задачи от начала до конца
  • 8 ак. ч.
    6. Бенчмарки
  • Публичные бенчмарки агентов: GAIA, SWE-bench Verified, tau-bench
  • Метрики надёжности: pass@k и pass^k; недетерминизм
  • Собственные предметные бенчмарки — когда и как их строить
  • Практика: запуск агента на подмножестве GAIA и интерпретация результата
  • 4 ак. ч.
    7. Безопасность агентов и red teaming
  • Небезопасные обходные пути: благая цель, небезопасный путь; выход за рамки задачи
  • Злоупотребление инструментами и prompt injection через инструменты
  • Guardrails и модели-супервайзеры; взгляд EU AI Act
  • Практика: red teaming демо-агента и отчёт об уязвимостях
  • 4 ак. ч.
    8. Мониторинг в продакшене
  • Онлайн-оценки и петли обратной связи от пользователей
  • Регрессионные наборы и интеграция в CI
  • Бюджеты стоимости / задержек; дашборды качества
  • Практика: встраивание оценок в CI-пайплайн
  • 4 ак. ч.
    9. Итоговый проект
  • Полноценный оценочный harness для AI-агента
  • Рубрика + автоматические оценки + прогон red team + отчёт
  • Защита итогового проекта
  • 4 ак. ч.

    Информация о курсе

    Время проведения:

    29.09.2026 - 24.11.2026
    27.10.2026 - 22.12.2026
    24.11.2026 - 19.01.2027


    Расписание занятий:

    Вт, Чт 17:45–21:00 (вечерняя группа).


    Оставить заявку → Ответим в течение 1 рабочего дня

    Длительность курса:

    8 недель



    Формат и место проведения:

    Адрес: Tartu mnt. 18, Tallinn / Онлайн.
    Gamma Intelligence Training Centre
    Курс проходит в аудиторном формате (до 12 человек в классе) и/или онлайн (Zoom / Microsoft Teams); общий размер группы до 18 человек.

    Язык обучения: русский

    Стоимость: 2500 EUR (НСО 24% включён)

    Общий объём курса: 80 ак. ч (40 аудиторных + 40 самостоятельной работы)
    Формат: лекции + практические занятия + самостоятельная работа.


    Преподаватели

    Николай Зубрилов

    Квалификация: Python-разработчик и Data Scientist; AI/LLM-разработчик в Mentastic; владелец Dataocean Analytics OÜ; коммерческий опыт в backend-разработке, анализе данных и AI/LLM.

    Специализация: Python, разработка AI/LLM, анализ данных и data science (Pandas, NumPy, Scikit-Learn), SQL (PostgreSQL / MySQL), REST API (FastAPI / Flask), автоматизация.

    Опыт преподавания: преподаватель курсов по Python, анализу данных и тестированию LLM в Gamma Intelligence Training Centre.

    Образование: магистр в области компьютерной и системной инженерии.

    Ознакомиться с CV