Как мы сопоставили 41 157 строк составов косметики со справочником на 5184 ингредиента

Разбор, 6 мин чтения. Задача звучала просто: человек вставляет состав с этикетки, мы показываем, что означает каждый компонент. На практике около 37% совпадений не находятся сравнением строк, потому что производители пишут одно и то же вещество десятком способов, а часть составов приезжает из распознавания фотографии этикетки. Материал открывается после короткого опроса и регистрации, читать его можно сразу.

Что внутри

10 разделов, около 6 минут чтения. Сам текст открывается после опроса и регистрации.

  1. Что приходит на вход
  2. Тир 1. Строгий ключ
  3. Тир 2. Агрессивный ключ для распознанных фото
  4. Тир 3. Опечатки через расстояние Левенштейна
  5. Тир 4. Русские названия
  6. Коллизии в справочнике
  7. Что получилось в цифрах
  8. Чем это отличается от зарубежных аналогов
  9. Где это работает
  10. Частые вопросы

Читайте также

Открыть этот материал

Пара вопросов про Вас, регистрация по почте, и материал откроется сразу, вместе с остальными в этом разделе.

Опрос занимает пару минут.

Опубликовано · обновлено