Оценка агентных систем: тестирование и оценка качества AI-агентов
Информация об обучении на данном курсе
Цель курса:
дать практические навыки оценки, тестирования и мониторинга AI-агентов — от трассировки и наблюдаемости
(observability), через построение наборов оценок (проверки на коде, LLM-as-a-judge, ручная экспертиза)
и проектирование верифицируемых задач и тестовых сред, до публичных бенчмарков, red teaming агентов
и мониторинга в продакшене.
Обучение проходит в центре Таллинна (Tartu mnt. 18, Tallinn) и/или онлайн.
В цену курса включены все учебные материалы.
При необходимости на время обучения выдаётся ноутбук.
Целевая группа:
Курс актуален, если Вы:
- QA / инженер по автоматизации тестирования и хотите добавить самую быстрорастущую специализацию в обеспечении качества — оценку AI-агентов;
- разработчик ПО и создаёте (или планируете) LLM- и агентные функции, и вам нужно уметь измерять их качество;
- специалист по данным / ML и движетесь в сторону прикладной оценки AI и LLMOps;
- IT-специалист в Эстонии или ЕС и ищете работу с возможностью удалёнки — платформы оценки AI нанимают по всему миру и ценят навыки этого курса;
- продакт-менеджер или аналитик AI-продукта и вам нужен системный способ понять, действительно ли ваши агенты работают;
- уже работаете на платформах оценки AI (разметка, оценка ответов) и хотите перейти к инженерному уровню оценки агентов.
Ключевые навыки, которые вы получите на курсе:
- Разбираться в архитектуре агентов: циклы планирования, инструменты, память, MCP
- Использовать кодинг-агентов (Claude Code, Cursor) как повседневный рабочий инструмент
- Инструментировать агентов трассировкой (OpenTelemetry, Arize Phoenix, LangSmith)
- Собирать golden-датасеты и проводить структурированные эксперименты
- Проектировать и валидировать оценщики LLM-as-a-judge
- Оценивать траектории агентов, выбор инструментов и сходимость
- Проектировать верифицируемые задачи и тестовые среды для агентов
- Запускать агентов на публичных бенчмарках (GAIA, SWE-bench) и интерпретировать результаты
- Проводить red teaming агентов: небезопасные обходные пути, злоупотребление инструментами, prompt injection
- Мониторить агентов в продакшене: онлайн-оценки, регрессии, стоимость и задержки
Требования к обучающимся:
- уверенный пользователь ПК
- английский, достаточный для технического обучения (ориентировочно B1/B2)
- базовые навыки Python настоятельно рекомендуются (жёсткого требования нет: практические работы идут с готовыми шаблонами и выполнимы с помощью AI-ассистентов для кода)
- желательно наличие собственного ноутбука (Windows / Mac / Linux, RAM 8 GB+), при необходимости на время обучения выдаётся ноутбук.
Результат обучения:
Окончившие данный курс:
- объясняют архитектуру и типовые режимы отказа агентных AI-систем
- инструментируют и трассируют агентов, читают и анализируют траектории агентов
- строят наборы оценок, сочетающие проверки на коде, LLM-as-a-judge и ручную экспертизу
- проектируют верифицируемые задачи и тестовые среды с приёмочными тестами
- запускают и интерпретируют оценки на бенчмарках, поддерживают регрессионные наборы
- проводят базовый red teaming агентов и составляют отчёты о качестве и уязвимостях
Методы обучения:
Общий объём курса: 80 академических часов, из которых 40 академических часов проходят в аудитории (контактная работа с преподавателем: лекции, практические занятия, семинары) и 40 ак. часов — самостоятельная работа.
Критерии оценки результатов обучения:
Результаты обучения оцениваются на основе самостоятельно выполненных практических работ и итогового проекта (полноценный оценочный harness для AI-агента).
Методы оценки:
При успешном выполнении практические и домашние работы получают оценку «зачёт».
Условия окончания курса:
Для успешного окончания курса и получения сертификата необходимо получить зачёт по 75% домашних работ и защитить итоговый проект.
Дополнительная информация:
Группа учебной программы: 0613 - Разработка и анализ программного обеспечения (0613 - Tarkvara ja rakenduste arendus ning analüüs)
Основные правила организации обучения (на эстонском языке)
Основные правила обеспечения качества учебного процесса (на эстонском языке)
Программа курса
| Модуль | Основные темы модуля | Объём |
| 1. Агентные системы и инструментарий оценщика |
|
4 ак. ч. |
| 2. Наблюдаемость и трассировка |
|
4 ак. ч. |
| 3. Оценщики I: датасеты и судьи |
|
4 ак. ч. |
| 4. Оценщики II: траектории и анализ отказов |
|
4 ак. ч. |
| 5. Среды и дизайн задач |
|
8 ак. ч. |
| 6. Бенчмарки |
|
4 ак. ч. |
| 7. Безопасность агентов и red teaming |
|
4 ак. ч. |
| 8. Мониторинг в продакшене |
|
4 ак. ч. |
| 9. Итоговый проект |
|
4 ак. ч. |
Информация о курсе
Время проведения:
29.09.2026 - 24.11.2026
27.10.2026 - 22.12.2026
24.11.2026 - 19.01.2027
Расписание занятий:
Вт, Чт 17:45–21:00 (вечерняя группа).
Оставить заявку → Ответим в течение 1 рабочего дня
Длительность курса:
8 недель
Формат и место проведения:
Адрес: Tartu mnt. 18, Tallinn / Онлайн.

Курс проходит в аудиторном формате (до 12 человек в классе) и/или онлайн (Zoom / Microsoft Teams); общий размер группы до 18 человек.
Язык обучения: русский
Стоимость: 2500 EUR (НСО 24% включён)
Общий объём курса: 80 ак. ч (40 аудиторных + 40 самостоятельной работы)
Формат: лекции + практические занятия + самостоятельная работа.
Преподаватели
Николай Зубрилов
Квалификация: Python-разработчик и Data Scientist; AI/LLM-разработчик в Mentastic; владелец Dataocean Analytics OÜ; коммерческий опыт в backend-разработке, анализе данных и AI/LLM.Специализация: Python, разработка AI/LLM, анализ данных и data science (Pandas, NumPy, Scikit-Learn), SQL (PostgreSQL / MySQL), REST API (FastAPI / Flask), автоматизация.
Опыт преподавания: преподаватель курсов по Python, анализу данных и тестированию LLM в Gamma Intelligence Training Centre.
Образование: магистр в области компьютерной и системной инженерии.