Как работает математика, стоящая за генераторами изображений на основе ИИ?
Мой брат постоянно пользуется Midjourney, и я очень любопытна, как эти программы вообще работают. Туда входит статистика и теория вероятностей?
Мой брат постоянно пользуется Midjourney, и я очень любопытна, как эти программы вообще работают. Туда входит статистика и теория вероятностей?
Точно! 🎨 Эти программы используют так называемые нейронные сети, которые тренируются на миллиардах изображений и учатся, какие пиксельные паттерны подходят друг к другу - в принципе, это работает через теорию вероятности, где программа на каждом шаге угадывает, какая следующая точка в изображении имеет смысл. Вообще-то, это захватывающе - как такая статистическая модель в итоге может выплёвывать реальные картинки! 🧠
Фишка в том, что эти системы не просто комбинируют вероятности, а работают через так называемые диффузионные модели - они начинают с чистого шума и "убирают шум" из изображения шаг за шагом на основе твоего текстового промпта 🎯 Это немного как если бы ты дал ребёнку очень размытое описание, а он потом итеративно добавлял всё больше деталей, пока в итоге не получится картинка, которая соответствует твоему описанию.
Статистика за этим, конечно, чудовищно сложная, но в конце концов всё упирается в векторные пространства и в то, как изображения и текст маппируются в один и тот же математический пространство, чтобы модель поняла, что ты на самом деле хочешь.
В Midjourney и подобных инструментах действительно куча математики, но самый важный момент, который многие упускают: программа в первую очередь не "понимает", что ты имеешь в виду. Она учится на паттернах в огромных объёмах данных и потом статистически угадывает, какие комбинации пикселей вероятнее всего имеют смысл вместе.
Модели диффузии работают примерно так: система начинает с шума и постепенно его убирает, одновременно используя твой текстовый запрос как якорь. Математически там происходит куча линейной алгебры и теории вероятностей - но большинству пользователей это понимать не нужно. Ты вводишь "собака на скейтборде", и модель миллионы раз вычисляет, какие значения пикселей наиболее вероятны, чтобы это создать. Это занимает несколько секунд, потому что там идёт невероятно много вычислений.
В чём сложность: эти системы по сути - высокоразвитые вероятностные машины, они иногда просто галлюцинируют какие-то вещи, потому что распределение вероятностей считает руку с 6 пальцами "достаточно реалистичной". Чем лучше твой запрос, тем лучше ты управляешь, в какую сторону вероятностей движется модель. Именно поэтому "инженерия запросов" в Midjourney так важна - ты пытаешься направить вероятности в нужное русло.
Войдите, чтобы ответить.