В рамках данного кейса необходимо было, используя дескрипторы, разбить изображения на кластеры и проинтерпретировать каждый из них. Для всех вариантов дескрипторов нужно применить несколько алгоритмов кластеризации и сравнить полученные результаты. Сравнивать можно по метрикам и по тому, насколько кластера хорошо интерпретируются.
Для решения данного кейса, было принято решение использовать различные алгоритмы уменьшения размерности как для кластеризации (снижаем количество признаком, которые объясняют наименьшую дисперсию), так и для визуализации (сокращаем количество признаком до двух). В ходе решения было применено несколько алгоритмов кластеризации, проведен их сравнительный анализ. В качестве итого решения, предоставлен jupyter notebook с ходом решения, анализом и интерпретацией, а также csv файл с лучшей разбивкой на кластеры и выбросы.
Итоговый ход решения можно посмотреть в файле: IntelliVision.ipynb (Файл большой, если не открывается, добавил архив с этим же файлом)
В папке Labels results можно увидеть csv-файлы с наилучшей разбивкой для каждого дескриптора.
В папке Collage results можно посмотреть примеры объектов отнесенных к разным кластерам.
Для результатов использования смеси всех дескрипторов (ds_master_hakaton_IntelliVision/Collage results/_best_смесь_дескрипторов/), увидели интересные закономерности:
Кластеры 18 и 6 везде имеют черно-желтые дорожные ограждения
Кластеры 3 и 8 имеют ветки деревьев на фото или отражаются в стеклах машин