Как социальные сети используют математику для ранжирования постов в ленте?

Я заметил, что мой инстаграм и тикток подстраиваются под то, с чем я взаимодействую, но мне интересно, какая математика за этим стоит. Например, они используют какую-то систему подсчёта баллов или вероятностную модель, чтобы решить, какие посты показывать мне в первую очередь?

6 ответов

★ Лучший ответ

Я начала отслеживать, что появляется у меня в ленте, после того как целую неделю лайкала все посты про аквариумные танки, какие только могла найти, и буквально через несколько дней алгоритм просто завалил меня контентом про растительные аквариумы - куда более агрессивно, чем я ожидала. То, что происходит за кулисами, - это работа моделей предсказания engagement, которые оценивают вероятность того, что ты лайкнешь пост, напишешь комментарий или потратишь на него время, а затем взвешивают эти предсказания в зависимости от того, насколько пост свежий, кто его опубликовал и насколько он похож на контент, с которым ты взаимодействовала раньше. Это не одна формула, а скорее система ранжирования, которая объединяет десятки таких вероятностных оценок, при этом разные платформы по-своему определяют, какие сигналы важнее всего (Instagram, похоже, сильно учитывает время просмотра, TikTok, судя по всему, одержима тем, пересмотришь ли ты пост ещё раз). Сама математика не секретная - это в основном логистическая регрессия или градиентный бустинг, - но настоящая сложность заключается в том, какие сигналы они выбирают для модели и сколько «весит» каждый из них.

Часть "персонализации" на самом деле не такая точная, как тебе может показаться - это меньше про какую-то одну элегантную математическую формулу и больше про беспорядочную кучу взвешенных сигналов. Они по сути оценивают каждый пост, используя такие штуки, как: как часто ты останавливаешься на похожем контенте, как долго ты на нём задерживаешься, кто его выложил, сколько взаимодействий он уже получил, свежесть поста и кучу других факторов, которые идут в алгоритмы ранжирования (представь нейросети, которые постоянно подстраиваются). Все эти сигналы обрабатываются вместе, обычно с помощью моделей машинного обучения, которые пытаются предсказать, будешь ли ты на самом деле взаимодействовать с постом или просто будешь листать дальше, и этот показатель предсказания определяет, где пост появится в твоей ленте. Платформы не публикуют точные веса, потому что это их ноу-хау, но да - под капотом точно есть математика, просто не того типа, который ты смог бы написать на доске.

Замечала ли ты, как лента меняется в момент, когда ты начинаешь взаимодействовать по-другому? Это алгоритм пересчитывается в реальном времени.

Платформы используют несколько систем оценки, работающих параллельно, а не одну волшебную формулу. Каждый пост получает оценку на основе сигналов взаимодействия (лайки, комментарии, репосты, время просмотра), свежести контента, твоей истории взаимодействия с автором, совпадений по типу контента и того, с чем взаимодействовали похожие пользователи. Эти оценки взвешиваются по-разному в зависимости от того, что платформе нужно оптимизировать - TikTok приоритизирует время просмотра и репосты, Instagram больше ориентируется на лайки и комментарии. Алгоритм затем ранжирует кандидатов и показывает тебе лучших претендентов. Представь это не как математическое доказательство, а как охранника клуба, который проверяет несколько критериев, чтобы решить, кого пустить.

Я проходила период, когда исследовала места для наблюдения птиц в интернете, смотрела кучу видео о природе, и внезапно моя лента наводнилась контентом про птиц. После пары недель, когда я прокручивала эти посты без взаимодействия, лента вернулась в норму. Это система взвешенной оценки перестраивается - когда я перестала взаимодействовать с контентом про птиц, эти посты упали в моём персональном ранжировании, и на поверхность вернулись другие темы. Математика здесь реальна, но она не пытается быть элегантной или справедливой; она просто пытается предсказать, что заставит тебя продолжать скролить. Они используют техники из систем рекомендаций (коллаборативную фильтрацию, нейронные сети), но точные веса и пороги, которые каждая платформа применяет, - это коммерческая тайна, так что никто снаружи не знает точную формулу.

Thomas Turner автор вопроса Это изменение алгоритма контента с птицами происходило постепенно в течение дней или это было более резким, как только ты перешёл определённый порог прокрутки мимо?

Суть в том, что это набор взвешенных факторов - время, которое ты проводишь на похожих постах, скорость твоего взаимодействия, следишь ли ты за аккаунтом, комментируешь ли или просто лайкаешь - всё это объединяется в итоговый скор релевантности, который определяет ранжирование. Это не "элегантная формула", а скорее "попробуй всё подряд и посмотри, что прилипнет", поэтому иногда ты заметишь дикие скачки в ленте, даже если твоё поведение изменилось совсем чуть-чуть. Они постоянно A/B-тестируют эти веса, поэтому то, что работает для ранжирования постов в твоей ленте, может быть совершенно другим для чьего-то ещё алгоритма.

Предыдущие ответы подходят к сути, но как-то обходят стороной, почему математика вообще имеет значение. Да, там есть взвешенные сигналы и они пересчитываются в реальном времени - это всё правда. Но эффективность работает благодаря тому, что платформы не просто складывают факторы вроде времени просмотра плюс статус подписчика. Они используют модели машинного обучения, обычно какую-то разновидность нейросети или градиентный бустинг, которые учатся видеть *закономерности* в том, как ведут себя миллионы людей. Поэтому когда ты вдруг начинаешь лайкать посты об аквариумах, алгоритм не просто считает эти лайки - он смотрит, с чем ещё обычно взаимодействуют люди, которые лайкают эти посты, как быстро ты скролишь мимо другого контента, даже такие вещи, как время суток, когда ты наиболее активен. Это намного более связанная система, чем простая система подсчёта очков.

Более хитрая часть в том, что эти платформы обычно оптимизируют время просмотра или активность, а не «показ тебе того, что ты действительно хочешь». Поэтому математика разработана так, чтобы предсказать, что заставит тебя продолжать скроллить, а это иногда означает подачу контента, который тебя злит или удивляет, вместо действительно полезного. «Взвешенные факторы», о которых говорилось раньше, реальны, но они фильтруются через модель, обученную максимизировать какой-то бизнес-метрику. Вот почему алгоритм может казаться жутковатым - не потому, что он разбирается в тебе лучше, чем ты в себе, а потому, что он достиг высокой точности в эксплуатации того, что захватывает человеческое внимание.

Я видел, как мой собственный лента кардинально меняется всего от пары кликов, так что система взвешивания точно работает - но вот что люди обходят стороной: алгоритм также учится показывать тебе контент, который держит тебя в скролле даже если ты не взаимодействуешь с ним явно, то есть посты от аккаунтов, на которые ты никогда не подписывался, или темы, которых ты едва касался, могут внезапно наводнить ленту, если они оптимизированы для захвата внимания любой ценой. Это не просто про совпадение твоих вкусов, а про максимизацию времени, проведённого в приложении - совсем другая история.

Ваш ответ

Войдите, чтобы ответить.