О проекте

MLPipeline — учебный проект о сверке данных

MLPipeline — учебный проект о сверке партий данных перед обучением модели. Образцы генерируются и сверяются в вашем браузере; учётных записей, тарифов и приёма данных на сервер нет.

Что здесь есть

  • Сверочный стол — эталон и новая партия на одной оси, с проверками, PSI и учебным вердиктом.
  • Документация — словарь понятий, начало работы, формат отчёта и формула PSI.
  • Четыре разбора — эталон, пороги дрейфа, черновик проверок и поломки выгрузки.

Чего здесь нет

  • приёма данных на сервер;
  • учётных записей и тарифов;
  • мониторинга работающей модели;
  • HTTP-API;
  • поддержки по договору.

Как устроен подход

  1. Выберите эталон

    Эталон — партия, на которой модель уже обучалась и вела себя как ожидалось. От неё берутся схема, диапазоны, наборы значений и границы бинов.

  2. Сверьте новую партию

    Проверьте схему, ожидания и распределения по одним и тем же правилам. Нарушения и сдвиги видны у каждой колонки, а не одной строкой в конце.

  3. Решите и сохраните

    Прочитайте вердикт, разберите причины и сохраните отчёт. В отчёте только агрегаты, поэтому его можно приложить к задаче без исходных строк.

На чём основан подход

  • TensorFlow Data Validation — выведенную из данных схему нужно пересматривать; отсюда правило «черновик до принятия».
  • Great Expectations — ожидания как проверяемые фразы; отсюда набор проверок с числом нарушений.
  • Evidently — дрейф по колонкам плюс правило доли; отсюда доля дрейфа и вердикт набора.
  • Facets — сравнение признаков по расстоянию; отсюда встречные бины, отсортированные по PSI.
  • whylogs — профили вместо строк; отсюда отчёт только из агрегатов.

Внешние ссылки ведут на документацию перечисленных инструментов. Логотипы, тексты и материалы этих проектов не используются.