Програмний модуль контентних рекомендацій фільмів і серіалів Netflix на основі косинусної подібності текстових описів

Loading...
Thumbnail Image

Date

Journal Title

Journal ISSN

Volume Title

Publisher

Тернопіль, ЗУНУ

Abstract

Метою роботи є розроблення та експериментальна перевірка програмного модуля контентних рекомендацій для об’єктів каталогу Netflix на основі формування інтегрованого текстового профілю та обчислення косинусної подібності між векторизованими описами з подальшим ранжуванням Top-N результатів. Методами дослідження та розроблення обрано аналіз предметної області рекомендаційних систем стрімінгових сервісів, дослідницький аналіз даних та оцінювання якості метаданих, передобробку тексту (очищення, нормалізація, вилучення стоп-слів), векторно-просторове представлення контенту методами Bag-of-Words/CountVectorizer (із можливістю застосування TF-IDF), обчислення матриці косинусної подібності, а також тестування функції рекомендацій і прототипу інтерфейсу у середовищі Notebook. У результаті виконання роботи реалізовано програмний модуль мовою Python із використанням бібліотек pandas та scikit-learn, який підтримує повний конвеєр: завантаження датасету Netflix (8807 записів, 12 атрибутів), обробку пропусків (зокрема заміну відсутніх значень у полі director на маркер Unknown та вилучення записів із критичними пропусками у полях cast і country), формування інтегрованого текстового поля overall_infos, векторизацію та обчислення матриці косинусної подібності N×N. Практичні випробування показали коректність ранжування рекомендацій: для запиту «LEGO Ninjago» максимальна подібність у Top-1 становить 0,466, а для запиту «Teenage Mutant Ninja Turtles» — 0,333, зі спаданням значень у межах Top-5, що забезпечує інтерпретовану підтримку вибору контенту. Результати роботи можуть бути використані як базове відтворюване рішення для навчальних і демонстраційних задач рекомендаційних систем, а також як основа для подальшого розвитку (перехід до TF-IDF і семантичних подань, гібридизація з поведінковими сигналами, оптимізація обчислень та розгортання у вебінтерфейсі). The purpose of the work is to develop and experimentally validate a contentbased recommendation software module for Netflix catalogue items by constructing an integrated textual profile and computing cosine similarity between vectorized descriptions, followed by Top-N ranking. The research and development methods include analysis of recommender systems in the context of streaming services, exploratory data analysis and metadata quality assessment, text preprocessing (cleaning, normalization, stop-word removal), vector-space content representation using Bag-of-Words/CountVectorizer (with an option to apply TF-IDF), cosine-similarity matrix computation, and functional testing of the recommendation routine and a Notebook-based user interface prototype. As a result, a Python module was implemented using pandas and scikit-learn. The full pipeline covers loading the Netflix dataset (8,807 records, 12 attributes), handling missing values (e.g., filling missing director values with the marker Unknown and removing records with critical missing values in cast and country), building the integrated field overall_infos, vectorization, and constructing an N×N cosine-similarity matrix. Empirical tests confirm correct recommendation ranking: for the query «LEGO Ninjago» the Top-1 similarity reaches 0.466, and for «Teenage Mutant Ninja Turtles» it reaches 0.333, with decreasing similarity values across the Top-5 list, enabling interpretable decision support for content selection. The results can be used as a reproducible baseline for educational and demonstration purposes in recommender systems, and as a foundation for further improvements (TF-IDF and semantic representations, hybridization with behavioural signals, computational optimization, and deployment in a web interface).

Description

Citation

Середа, І. В. Програмний модуль контентних рекомендацій фільмів і серіалів Netflix на основі косинусної подібності текстових описів = Software module for content-based recommendations of Netflix movies and TV shows using cosine similarity of textual descriptions : кваліфікаційна робота : спец. 122 – комп’ютерні науки ; освітньо-професійна програма – комп’ютерні науки / Іван Володимирович Середа ; наук. керівник к.т.н., доц. Т. В. Лендюк. Тернопіль : ЗУНУ, 2026. 56 с.

Endorsement

Review

Supplemented By

Referenced By