Prompt & Context Engineering по шагам: от контракта задачи до evals

Начать обучение!

Преимущества

Роли, system prompts, context windows, tool calling и evals кажутся набором несвязанных техник? Курс собирает их в последовательный цикл: контракт задачи, нужный контекст, ограниченное действие, проверка результата и журнал решения. Шаблоны и контрольные точки помогут понять, что именно проверять на каждом этапе и почему система стала лучше или хуже.

Цельная карта дисциплины

Связь prompts, context, tools и evals

Пошаговые шаблоны

Контракт и проверки для каждой задачи

Понятные критерии

Что считать успехом, ошибкой и остановкой

Уверенность через практику

Повторные прогоны вместо догадок

Стоимость часа занятий: 5 000,00 рублей

План занятий

Prompt system architecture Context engineering and retrieval design Agent evaluation and regression testing AI observability and risk control

LLM и агент как вероятностная инженерная система

4 занятия

4 недели

Учащийся получает рабочую модель системы: LLM генерирует ответ, agent loop выбирает действия, инструменты меняют внешний мир, а проверки и человек ограничивают риск. «Предсказуемость» определяется не одинаковым текстом, а стабильным соблюдением контракта, границ, порядка действий и критериев качества. Темы: • модель, prompt, context, memory, tool и agent loop: разные ответственности; • источники вариативности и классы отказов на больших задачах; • уровни автономии и цена ошибки; • measurable behavior: compliance, correctness, completeness и safe refusal. Практический артефакт: failure taxonomy и карта контрольных точек выбранного агента.

Контракт задачи и архитектура prompt-системы

4 занятия

4 недели

Вместо монолитного prompt учащийся проектирует систему артефактов: роль задаёт границы, workflow — последовательность, policy — неизменяемые правила, task — конкретную цель, output schema — проверяемый результат. Разбираются приоритеты инструкций, конфликты и правила остановки. Темы: • цель, scope, authority boundaries и явные non-goals; • входной контракт, output schema и acceptance criteria; • policy, role, workflow, task и reference: разделение ответственности; • instruction hierarchy, конфликт требований, fallback и stop conditions. Практический артефакт: модульная prompt-система вместо исходного mega-prompt.

Формулировка инструкций, которые можно проверить

4 занятия

4 недели

Учащийся превращает абстрактные пожелания вроде «будь внимателен» в наблюдаемое поведение. Инструкции связываются с условиями применения, требуемыми свидетельствами и способом проверки. Few-shot-примеры используются как контрактные демонстрации, а не как украшение prompt. Темы: • конкретность, структура, ограничения и формат результата; • positive/negative examples, counterexamples и граничные случаи; • обязательные evidence fields, uncertainty и запрет выдуманных фактов; • open question, assumption и stop: когда агент не должен продолжать. Практический артефакт: библиотека шаблонов инструкций и антипаттернов с тестовыми примерами.

Context Engineering: нужная информация в нужный момент

4 занятия

4 недели

Модуль рассматривает контекст как ограниченный бюджет. Учащийся определяет источники истины, загружает информацию по триггерам, отделяет постоянные правила от динамических фактов и строит progressive disclosure. Особое внимание — свежести, provenance, противоречиям и потере важных ограничений при сжатии. Темы: • context map, token budget и критерии релевантности; • статические инструкции, task context, retrieved context и conversation state; • chunking по смысловым границам, summary, compaction и context handoff; • freshness, source attribution, конфликт фактов и защита чувствительных данных. Практический артефакт: context-loading policy и матрица «триггер → источник → объём → freshness check».

Декомпозиция крупных задач и управляемый agent loop

4 занятия

4 недели

Учащийся проектирует этапы discovery, planning, execution, review и verification, не позволяя агенту смешивать решения и реализацию в одном непрозрачном проходе. Каждый этап получает вход, выход, ограничение, checkpoint и условие остановки. Темы: • task graph, зависимости и critical path; • least-to-most decomposition и bounded iteration; • план как проверяемый артефакт, а не скрытое намерение модели; • checkpoint, approval gate, retry budget, escalation и handoff. Практический артефакт: state machine или workflow-схема для составной задачи.

Инструменты, tool calling и MCP без потери контроля

4 занятия

4 недели

Модуль учит рассматривать каждый инструмент как отдельную trust boundary. Учащийся проектирует узкие интерфейсы, валидирует аргументы и результаты, разделяет read и write capabilities и требует подтверждения для внешне видимых, дорогих или необратимых действий. MCP рассматривается как стандарт подключения контекста и tools, но не как автоматическая гарантия качества. Темы: • tool contract: schema, preconditions, errors, idempotency и timeout; • read-only по умолчанию, least privilege и approval-gated writes; • MCP server selection, provenance, permissions и untrusted output; • обработка частичного успеха, повторов, stale state и tool failure. Практический артефакт: tool registry с правами, рисками и проверками для каждого инструмента.

Evals: как доказать, что агент стал лучше

4 занятия

4 недели

Учащийся строит eval-набор до оптимизации prompt-системы. Проверки делятся на детерминированные assertions, экспертную rubric-оценку и сравнительные прогоны. Набор включает обычные, граничные, конфликтные и adversarial случаи, чтобы улучшение одного сценария не скрывало регрессию другого. Темы: • golden set, representative cases и failure-driven dataset; • exact checks, schema validation, invariants и model-based graders; • pass rate, severity-weighted score, variance, latency и cost; • regression testing, prompt injection cases и human review calibration. Практический артефакт: versioned eval-suite с baseline и отчётом двух версий prompt-системы.

Наблюдаемость, версии и эксплуатация prompt-системы

4 занятия

4 недели

Модуль переводит prototype в сопровождаемую систему. Учащийся фиксирует версии model/prompt/context/tools, строит структурированные traces, различает качество, стоимость и скорость и готовит безопасный rollout. Логи не должны раскрывать секреты или бесконтрольно сохранять пользовательские данные. Темы: • trace: вход, выбранный маршрут, tools, проверки, результат и причина stop; • versioning prompt, model, eval dataset и retrieved sources; • canary, shadow run, rollback и критерии отключения; • incident review, privacy, retention, cost budget и drift monitoring. Практический артефакт: operational dashboard schema и runbook отказа агента.

Финальный проект: проверяемый агент для большой задачи

4 занятия

4 недели

Учащийся выбирает крупную задачу — например, анализ требований, подготовку изменения в репозитории, исследовательский отчёт или обработку обращений — и строит полный agent workflow. Система должна корректно работать на обычных случаях, останавливаться при отсутствии authority/evidence, объяснять наблюдаемые решения и проходить regression-evals. Темы: • product requirement и риск-классификация агента; • prompt/context/tool architecture и threat model; • eval-driven iterations и анализ расхождений; • документация, demo, rollout plan и backlog улучшений. Итоговый проект: репозиторий prompt-системы с версиями артефактов, context map, tool registry, минимум 20 eval cases, baseline, результатами повторных прогонов, runbook и rollback plan.

Еще курсы и семинары

Статьи

  • Все
  • Экономика
  • Научпоп
  • Менеджмент
  • Технологии
  • Блог

Требования к системе — Почему проекты ломаются не в коде, а в ожиданиях людей

3 июня 2026 г. 21:38

Почему проекты ломаются не в коде, а в ожиданиях людей?

В ИТ-проектах есть одна неприятная закономерность: команда может хорошо писать код, использовать правильную архитектуру, вести backlog, проводить встречи, согласовывать документы — и все равно в конце услышать от заказчика: «Мы ожидали не этого».