О проекте
MLPipeline — учебный проект о сверке данных
MLPipeline — учебный проект о сверке партий данных перед обучением модели. Образцы генерируются и сверяются в вашем браузере; учётных записей, тарифов и приёма данных на сервер нет.
Что здесь есть
- Сверочный стол — эталон и новая партия на одной оси, с проверками, PSI и учебным вердиктом.
- Документация — словарь понятий, начало работы, формат отчёта и формула PSI.
- Четыре разбора — эталон, пороги дрейфа, черновик проверок и поломки выгрузки.
Чего здесь нет
- приёма данных на сервер;
- учётных записей и тарифов;
- мониторинга работающей модели;
- HTTP-API;
- поддержки по договору.
Как устроен подход
Выберите эталон
Эталон — партия, на которой модель уже обучалась и вела себя как ожидалось. От неё берутся схема, диапазоны, наборы значений и границы бинов.
Сверьте новую партию
Проверьте схему, ожидания и распределения по одним и тем же правилам. Нарушения и сдвиги видны у каждой колонки, а не одной строкой в конце.
Решите и сохраните
Прочитайте вердикт, разберите причины и сохраните отчёт. В отчёте только агрегаты, поэтому его можно приложить к задаче без исходных строк.
На чём основан подход
- TensorFlow Data Validation — выведенную из данных схему нужно пересматривать; отсюда правило «черновик до принятия».
- Great Expectations — ожидания как проверяемые фразы; отсюда набор проверок с числом нарушений.
- Evidently — дрейф по колонкам плюс правило доли; отсюда доля дрейфа и вердикт набора.
- Facets — сравнение признаков по расстоянию; отсюда встречные бины, отсортированные по PSI.
- whylogs — профили вместо строк; отсюда отчёт только из агрегатов.
Внешние ссылки ведут на документацию перечисленных инструментов. Логотипы, тексты и материалы этих проектов не используются.