Тестировщик LLM: оценка качества AI-систем (с основами Python)


Информация об обучении на данном курсе

Цель курса: дать базовые теоретические знания и практические навыки, необходимые для тестирования и оценки качества систем на основе больших языковых моделей (LLM) — от ручной оценки ответов по рубрикам до автоматизированных eval-пайплайнов, тестирования RAG-систем и поиска уязвимостей (red teaming). Курс включает блок основ Python — главного рабочего инструмента в этой профессии.

Обучение проходит в аудиторном формате, в современном компьютерном классе по адресу Tartu mnt. 18, Tallinn. В цену курса включены все учебные материалы. При необходимости на время обучения выдается ноутбук.


Целевая группа:

Курс актуален, если Вы:

  • начинающий или действующий тестировщик и хотите добавить в профиль самую востребованную специализацию — тестирование AI-систем;
  • специалист из другой сферы и рассматриваете вход в AI-индустрию через оценку качества моделей — направление с низким порогом входа;
  • лингвист, редактор, переводчик или аналитик и хотите применить внимательность к деталям и сильный язык в работе с AI (оценка ответов моделей, разметка, рубрики);
  • уже подрабатываете на платформах оценки AI (аннотирование, сравнение ответов) и хотите перейти на более сложные и высокооплачиваемые задачи с автоматизацией;
  • разработчик или инженер и вам нужно понимать, как проверять качество и безопасность LLM-функций в ваших продуктах;
  • работаете с AI-инструментами ежедневно и хотите системно понимать их ограничения, типовые сбои и способы проверки.

Ключевые навыки, которые Вы получите на курсе:

  • Писать программы на Python: типы данных, циклы, функции, работа с файлами
  • Понимать устройство LLM-систем: токены, контекст, недетерминизм ответов
  • Различать классы дефектов AI: галлюцинации, смещения (bias), инъекции промптов
  • Составлять промпты и проектировать рубрики оценки ответов
  • Проводить ручную оценку: side-by-side сравнение, ранжирование, фиксация failure modes
  • Применять метрики качества и метод LLM-as-judge
  • Строить автоматические eval-пайплайны (promptfoo, DeepEval, pytest)
  • Тестировать RAG-системы и AI-агентов (tool-use, трейсинг)
  • Проводить базовый red teaming: prompt injection, jailbreak-тесты
  • Оформлять отчёты о дефектах и уязвимостях AI-систем

Требования к обучающимся:

  • уверенный пользователь ПК; опыт программирования НЕ требуется (курс включает блок основ Python)
  • владение английским языком на уровне, достаточном для чтения технической документации (ориентировочно A2/B1); для работы на международных платформах оценки AI на практике требуется уровень от B2
  • желательно наличие собственного ноутбука (Windows / Mac, оперативная память 8 GB), при необходимости на время обучения выдается ноутбук

Результат обучения:

Окончившие данный курс:

  • пишут скрипты на Python для обработки данных и автоматизации проверок
  • понимают архитектуру LLM-систем (чат-боты, RAG, агенты) и типовые классы их дефектов
  • оценивают ответы моделей по рубрикам и оформляют результаты оценки
  • строят автоматические eval-пайплайны с метриками и регрессионными прогонами
  • тестируют RAG-системы и агентов, применяют базовые техники red teaming
  • составляют отчёты о качестве и уязвимостях AI-систем

Методы обучения:

Лекции, практические занятия, семинары, демонстрация, самостоятельная работа.

Общий объем курса: 120 академических часов, из которых 64 академических часа проходят в аудитории (в т.ч. практические занятия).

Критерии оценки результатов обучения:

Результаты обучения оцениваются на основе самостоятельно выполненных практических работ.

Методы оценки:

При успешном выполнении практические и домашние работы получают оценку «зачет».

Условия окончания курса:

Для успешного окончания курса и получения сертификата необходимо получить зачет 75% домашних работ.

Дополнительная информация:

Группа программы обучения: 0613 - Анализ и разработка программного обеспечения (0613 - Tarkvara ja rakenduste arendus ning analüüs)
Основные правила организации обучения (на эстонском языке)
Основные правила обеспечения качества учебного процесса (на эстонском языке)

Программа курса

Модуль Основные темы модуля Объем
Блок 1. Основы Python
  • Проводится совместно с группой курса «Основы языка программирования Python» (занятия 1–8).
  • Установка и среды (IDLE, Jupyter Notebook), переменные и типы данных.
  • Условия, циклы, списки, строки, словари и множества.
  • Функции и модульность кода.
  • Файлы (CSV), установка пакетов (pip), обработка исключений.
  • 32 ак. ч.
    1. Python для тестирования LLM
  • Виртуальные окружения (venv), организация проекта.
  • HTTP-запросы (requests), вызов LLM через API (OpenAI, Anthropic).
  • JSON: датасеты тест-кейсов, разбор ответов моделей.
  • Основы pytest; первые сводки результатов (pandas).
  • 4 ак. ч.
    2. LLM и GenAI-системы: что тестируем
  • Как работают LLM: токены, контекст, temperature, недетерминизм.
  • Типы систем: чат-боты, RAG, агенты; жизненный цикл LLM-приложения.
  • Классы дефектов: галлюцинации, bias, инъекции, деградация.
  • Чем тестирование LLM отличается от классического QA; EU AI Act, ISO/IEC 25059.
  • 4 ак. ч.
    3. Промпт-инжиниринг и ручная оценка
  • Техники промптинга для тестировщика.
  • Дизайн рубрик оценки; side-by-side сравнение и ранжирование ответов.
  • Human-in-the-loop: как устроена работа платформ оценки AI.
  • Фиксация failure modes: письменные отчёты о дефектах.
  • 4 ак. ч.
    4. Метрики качества и LLM-as-judge
  • Метрики: точность, полнота, consistency, faithfulness, relevance.
  • Reference-based и reference-free оценка.
  • LLM-as-judge: дизайн judge-промптов и их валидация.
  • Error analysis: таксономия отказов, приоритизация.
  • 4 ак. ч.
    5. Автоматизация: eval-пайплайны
  • Пайплайн: датасет → метрики → прогон → регрессия.
  • Инструменты: promptfoo, DeepEval + pytest.
  • Golden-датасеты и синтетические тест-кейсы.
  • Интеграция в CI; дашборды качества.
  • 4 ак. ч.
    6. Тестирование RAG и AI-агентов
  • Архитектура RAG и её точки отказа: retrieval, grounding.
  • Метрики RAG (подход Ragas): faithfulness, context relevance.
  • Агенты: корректность вызова инструментов (tool-use).
  • Трейсинг и наблюдаемость (LangSmith).
  • 4 ак. ч.
    7. Red teaming и безопасность AI
  • Prompt injection и jailbreak: техники и защита.
  • Adversarial-тестирование; аудит bias/fairness.
  • Guardrails и модерация контента.
  • Отчёт об уязвимостях AI-системы.
  • 4 ак. ч.
    8. Итоговая практическая работа
  • Комплексная оценка учебного LLM-приложения.
  • Рубрика + автоматический eval-прогон + red-team проверка.
  • Оформление отчёта о качестве.
  • Защита итоговой работы.
  • 4 ак. ч.

    Информация о курсе

    Время проведения:

    06.10.2026 - 19.11.2026
    27.10.2026 - 11.12.2026


    Расписание занятий:

    Блок 1 (Python): Вт, Чт, Пт 17:45–21:00 (3 недели).
    Блок 2 (LLM): Вт, Чт 17:45–21:00 (4 недели).


    Оставить заявку →Ответим в течение 1 рабочего дня

    Длительность курса:

    7 недель



    Формат и место проведения:

    Адрес: Tartu mnt. 18, Tallinn.
    Gamma Intelligence Training Centre
    Курс проводится:

      в аудиторном формате, в современном компьютерном классе, по адресу Tartu mnt. 18 (до 12 человек в классе).
      в удаленном формате (Zoom или Microsoft Teams).
    Размер группы (класс + онлайн) — до 18 человек. Блок основ Python проходит совместно с группой курса «Основы языка программирования Python».

    Язык обучения: русский

    Стоимость: 1700 EUR (НСО 24% включен)

    Общий объем курса: 120 ак. ч.
    Включает в себя:
    • Аудиторные занятия: 64 ак.ч.
    • Самостоятельная работа: 56 ак.ч.


    Преподаватели

    Роман Кутселепа (блок «Основы Python»)

    Квалификация: Свыше 5 лет в разработке ПО. Специализация: веб-дизайн, разработка на JavaScript, эффективное использование программных продуктов в компании

    Опыт преподавания: Свыше 5 лет опыта в преподавании и обучении персонала

    Образование: Anglia Ruskin University 2010 г. (Англия)

    Ознакомиться с CV


    Николай Зубрилов (LLM-блок)

    Квалификация: Python-разработчик и Data Scientist; разработчик AI/LLM в компании Mentastic, владелец Dataocean Analytics OÜ, Python-разработчик в области анализа данных и автоматизации.

    Специализация: Разработка на Python, AI/LLM-разработка, анализ данных и data science (Pandas, NumPy, Scikit-Learn), SQL / MySQL / PostgreSQL, REST API (FastAPI, Flask), веб-скрейпинг и автоматизация.

    Опыт преподавания: Преподаватель курса «Анализ данных с помощью Python и SQL» в Gamma Intelligence Training Centre.

    Образование: Магистерская степень — компьютерная и системная техника.

    Ознакомиться с CV