Владимир Ильичев, Fedorov V.O. · Cifra LLC Journals 2026 · 2026
DOI: 10.60797/irj.2026.170.33
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
В условиях экспоненциального роста объемов данных в индустрии туризма и гостеприимства возникает острая необходимость в применении высокопроизводительных инструментов для их обработки и анализа. В данной работе представлено комплексное исследование, посвященное использованию современных библиотек Pandas, Polars и PySpark для Python на примере анализа большого датасета Expedia Hotel Recommendations. Целью исследования является количественная оценка и сравнение их эффективности при решении трёх ключевых задач машинного обучения: регрессии (прогнозирование orig_destination_distance — расстояния до отеля), кластеризации (сегментация пользовательских запросов) и классификации (is_booking — предсказание факта бронирования). В ходе экспериментов проведено прямое сравнение библиотек по времени выполнения и потреблению RAM на одинаковой вычислительной конфигурации. Результаты показывают, что Polars превосходит Pandas и PySpark (при локальном использовании) по скорости и по экономии памяти при ETL-операциях, а также обеспечивает более стабильную производительность при масштабировании.
No comments yet — start the discussion below.