Привет! Хочу рассказать о своем первом опыте работы с ML-моделями. Все началось в третьем семестре, когда я присоединился к университетскому проекту, связанному с нейронными сетями. После изучения основ Pytorch я приступил к задачам проекта и решил изучить классический машинный интеллект. Так я наткнулся на известный датасет Титаника, целью которого было предсказать выживание пассажиров.

Я начал с загрузки необходимых библиотек и обработки данных. Провел разведочный анализ, визуализируя шансы на выживание по полу и классу. Применил различные методы предобработки данных, заполнив пропуски и преобразовав категориальные признаки в числовые. Затем я разделил данные на обучающую и валидационную выборки.

Обучил две модели: Random Forest и Logistic Regression. Random Forest показал более высокую точность, но низкий Recall, в то время как логистическая регрессия продемонстрировала высокую полноту, находя более 80% выживших. В итоге я подготовил результаты для Kaggle, создав CSV-файл с предсказаниями.

Этот опыт помог мне лучше понять работу с ML и важность обработки данных. В дальнейшем планирую изучить другие модели и методы.