Описание: Как исследователи адаптировали искусственный интеллект для моделирования физических процессов, достигнув ускорения в миллион раз по сравнению с традиционными методами расчётов.
Современные нейросети сталкиваются со сложностью при работе с физическим миром: природа существует в непрерывном пространстве, а не в дискретных ячейках. Температура изменяется плавно между метеорологическими станциями, жидкость движется между узлами расчётной сетки, атмосфера присутствует везде, а не только там, где находятся спутники. Поэтому модели, эффективные при распознавании текста или изображений, нельзя просто применить к физическим явлениям и ожидать аналогичной надёжности. Исследователи разработали метод трансформации привычных нейросетей, чтобы они обучались описывать непрерывные процессы вместо работы с фиксированным набором точек.
Ключевую роль в этом подходе играют нейронные операторы, введённые в 2020 году для обработки функций. В отличие от обычных нейросетей, которые получают конечный набор значений и ищут между ними закономерности, нейронный оператор решает иную задачу: он обучается преобразовывать одну функцию в другую. Это позволяет обучить модель на данных одного разрешения и затем использовать её на сетках с иной детализацией.
Примером актуальности новой методологии служит метеорология. Температура, давление, влажность и ветер меняются непрерывно во времени и пространстве. Измерительные приборы предоставляют только отдельные значения. Между двумя станциями может быть несколько сотен километров, но параметры атмосферы в промежутке между ними реально существуют. Для прогнозирования погоды модели должны восстанавливать физические связи между доступными данными измерений.
С текстовыми и графическими данными проще: предложение разбивается на токены, фотография — на пиксели. Множество архитектур нейросетей разрабатывались специально для таких дискретных данных. Когда речь идёт о физике, такая привязка к отдельным элементам становится препятствием.
Рассмотрим температурную карту региона. Область можно разбить на матрицу 128×128, получив 16 384 значения. Более детальная матрица 256×256 содержит 65 536 точек. При меньшей нужной детализации хватит 64×64 и 4096 значений. Во всех трёх сценариях температурное распределение остаётся одним и тем же непрерывным полем. Изменяется только число точек, используемых для его описания компьютером.
Стандартная нейросеть не обязательно видит три матрицы как различные представления одного явления. Эта проблема особенно выражена у свёрточных архитектур. Фильтр анализирует несколько соседних элементов. На грубой матрице соседи охватывают обширную территорию, на подробной — значительно меньший район. Количество элементов неизменно, но территориальный размер изменился. Следовательно, операция, выученная сетью при одном разрешении, получает иное физическое значение при переходе на другую матрицу.
Нейронный оператор стремится преодолеть эту зависимость. Вместо индексов ячеек модель принимает во внимание реальные координаты в пространстве и обучается обрабатывать функцию целиком. Математически операцию над соседними элементами заменяют операцией над непрерывной областью (например, интегралом). Компьютер не в состоянии вычислить бесконечное множество точек и использует конечную сетку, но её плотность больше не должна влиять на суть расчёта.
В своей работе авторы предложили универсальный механизм переделки известных нейросетей для работы с функциями. Полносвязные слои могут быть переделаны в интегральные операторы. В свёрточных сетях область влияния фильтра можно привязать к реальным координатам вместо числа ячеек. Графовые нейросети получают способность учитывать взаимное расположение точек и правильно суммировать их вклады. Тот же принцип применим к трансформерам.
Один из наиболее известных методов называется нейронным оператором Фурье (FNO). Часть расчётов перемещается в частотное пространство посредством преобразования Фурье. Это позволяет сети учитывать связи между отдалёнными участками физического поля и меньше зависеть от конкретной матрицы, на которой осуществлялось обучение.
Нейронные операторы уже применяют в областях, где классическое компьютерное моделирование требует значительных вычислительных затрат. К примерам относятся квантовая химия, моделирование чёрных дыр, анализ распространения углекислого газа при закачке в земные слои и расчёт поведения плазмы в термоядерных установках. В последнем случае модель предсказывает моменты, когда плазма резко охлаждается или теряет устойчивость. Для ряда расчётов учёные получали ускорение до миллиона раз в сравнении с классическими методами.
В новом исследовании подход апробирован на потоках жидкостей. Первый тест применял уравнения Навье-Стокса, описывающие движение жидкостей и газов. Модель принимала внешние воздействия на жидкость и вычисляла, как изменится завихренность со временем. Иначе говоря, нейросети нужно было рассчитать не несколько отельных чисел, а целое поле, изменяющееся в пространстве.
Во втором тесте использовался закон Дарси, связанный с фильтрацией жидкости через пористую среду. Подобные расчёты необходимы для изучения проникновения воды через грунт или распределения жидкости в горных породах. Вновь возникает непрерывное поле, которое компьютер вынужден представлять ограниченным числом значений.
Наиболее поучительная проверка произошла после завершения обучения. Нейронные операторы обучались на матрице 128×128, затем испытывались на матрицах 64×64 и 256×256. Специального переобучения для новых размеров не проводилось. Несмотря на изменение разрешения, нейронные операторы демонстрировали значительно лучшую точность в сравнении с обычными нейросетями.
Для физического моделирования это различие критично. Если алгоритм действительно усвоил связь между физическими полями, количество точек не должно кардинально изменить результат. Матрица — это инструмент передачи функции компьютеру, но не сама функция.
Обычные нейросети можно обучать на нескольких разрешениях одновременно, но опыт выявил слабость метода. Сеть адаптируется к уже встречавшимся размерам, однако её точность падает при столкновении с незнакомым разрешением. Модель запоминает несколько матриц вместо единого универсального правила, независимого от числа точек.
Возможен альтернативный подход: преобразовать входные данные в фиксированный размер. К примеру, уменьшить матрицу 256×256 до стандартных 128×128, выполнить вычисление, потом масштабировать результат обратно. Формально нейросеть будет принимать данные переменных размеров, однако деталь будет потеряна при первом уменьшении. Модель её не увидит.
Нейронный оператор функционирует по-другому. Количество обучаемых параметров не должно расти вместе с разрешением. Один набор параметров описывает трансформацию функций, матрица задаёт только координаты, где компьютер получает входные данные и рассчитывает выходные.
Такое свойство имеет практическое значение. Более детальная физическая модель, как правило, требует больше расчётов. Исследователь может располагать множеством экономичных расчётов низкого разрешения и лишь несколькими очень подробными. Нейронные операторы дают возможность совмещать данные различных разрешений при подготовке одной модели.
Подготовку можно структурировать поэтапно. Сначала модель обрабатывает более экономичные данные низкого разрешения, далее переходит к высокодетальным. Подобная последовательность предотвращает впустую потраченные дорогостоящие расчёты на начальных этапах, когда сеть изучает базовые закономерности.
По завершении подготовки нейронный оператор может работать даже с разрешением, которое он никогда не встречал ранее. Для этой способности используют выражение zero-shot super-resolution, то есть увеличение детализации без дополнительного обучения. От классического увеличения изображения это отличается существенно. Алгоритм не генерирует правдоподобные фрагменты между пикселями, а вычисляет одну физическую функцию в большем количестве позиций.
Новый метод не позволяет полностью отказаться от классической вычислительной физики. Компьютер всё равно меняет непрерывное пространство конечной матрицей, поэтому ошибки численного приближения остаются. Сложности возникают при нестандартной геометрии, сетках с неоднородной плотностью точек и расчётах очень высокого разрешения. Затруднительна также ситуация, когда нужно одновременно учитывать локальные процессы около каждой точки и воздействие удалённых зон.
Суть нововведения легче всего проиллюстрировать на температурных картах. Обычная нейросеть воспринимает матрицы 64×64, 128×128 и 256×256 как три самостоятельных форма данных. Нейронный оператор обучается видеть их как три способа измерить одно поле температур. Благодаря этому модель обучается на одной плотности точек, а затем производит расчёты на другой, не требуя повторного усвоения физических закономерностей.
