Тысячи комментариев говорят несколько разных вещей — этот инструмент выясняет, каких
Забирает все комментарии под видео через YouTube Data API, считает эмбеддинги, кластеризует пространство и просит модель назвать каждый кластер. На выходе панель на Streamlit, где ветка из 4000 комментариев превращается в восемь вещей, которые люди действительно сказали. Бэкенд эмбеддингов сменный — OpenAI, локальная модель через Ollama или MLX на Apple silicon.
YouTube Data API → SQLite, видео, комментарии и ответы
embed
OpenAI, локальная модель через Ollama или MLX на Apple silicon — один интерфейс
reduce
PCA, UMAP или t-SNE, выбор в интерфейсе, а не в коде
cluster
scikit-learn поверх сжатого пространства
name
модель подписывает каждый кластер по самым характерным комментариям
read
Streamlit рисует кластеры и то, о чём говорит каждый
Интересной частью была вовсе не кластеризация — а то, что раздел комментариев
это распределение, а не список, и ни один интерфейс не относится к нему так.