Image default
Нейросети

Создан инструмент для проверки данных перед обучением ИИ-моделей

Специалисты Центра практического искусственного интеллекта Сбербанка и Института AIRI разработали открытый инструмент, который позволяет выявлять дефекты в данных до обучения рекомендательных моделей и оценивать применимость результатов экспериментов в реальных условиях. Об этом сообщили ТАСС в пресс-службе Сбера.

«Ученые Центра практического искусственного интеллекта Сбербанка и Института AIRI представили SplitLight — открытый инструмент для диагностики данных перед обучением и сравнением рекомендательных моделей», — говорится в сообщении.

Инструмент позволяет обнаруживать сбои в логировании, смещенные временные метки и дублирующиеся события, которые могут повлиять на итоговые метрики. Кроме того, с его помощью можно фиксировать ключевые статистические характеристики используемого подхода к подготовке выборки. Это призвано повысить воспроизводимость исследований и упростить сопоставление результатов разных команд.

Еще одна функция инструмента связана с оценкой соответствия эксперимента реальным условиям эксплуатации. Система помогает определить, не попали ли в обучающую выборку данные из будущего, учитываются ли новые пользователи и объекты, а также насколько различаются тренировочная и валидационная выборки.

«Для продуктовых команд в маркетплейсах, стримингах и медиа это надежная защита перед дорогими экспериментами: быстрая проверка данных, выбор корректного сплита и подтверждение того, что тест приближен к реальности. Это снижает риск внедрения моделей, эффективных лишь на бумаге. Исследовательским группам SplitLight упрощает документирование, воспроизводимость и сравнение с публикациями, а также позволяет анализировать сторонние датасеты для корректной оценки своих решений», — приводятся в сообщении слова старшего управляющего директора, директора по AI-трансформации Сбербанка Сергея Рябова.

Читать далее:
«Яндекс Погода» подготовила с помощью ИИ прогноз на вторую половину лета

Команда проекта во главе с исполнительным директором по исследованию данных Центра практического искусственного интеллекта Сбербанка Алексеем Васильевым протестировала SplitLight на шести популярных открытых наборах данных. Как показало тестирование, даже незначительные изменения в разбиении данных могут заметно повлиять на метрики и оценку качества модели.

Похожие записи

Эксперт Рыбаков: центры обработки данных для ИИ могут стать модульными

admin

Стало известно, сколько айтишники тратят на искусственный интеллект

admin

Пентагон поссорился с ИИ-гигантом: компания не идет на поводу у военных

admin