Главная
АИ #30 (316)
Статьи журнала АИ #30 (316)
Ai for science: искусственный интеллект как инструмент научного познания

Ai for science: искусственный интеллект как инструмент научного познания

Цитирование

Ханина А. И. Ai for science: искусственный интеллект как инструмент научного познания // Актуальные исследования. 2026. №30 (316). С. 40-44. URL: https://apni.ru/article/15736-ai-for-science-iskusstvennyj-intellekt-kak-instrument-nauchnogo-poznaniya

Аннотация статьи

В статье рассматривается направление AI for Science – применение методов искусственного интеллекта в фундаментальных и прикладных научных исследованиях. Обосновывается тезис о том, что искусственный интеллект меняет не только скорость, но и саму структуру научного поиска, смещая роль исследователя от перебора гипотез к постановке задач и верификации результатов. Проанализированы основные классы применений – суррогатное моделирование, решение обратных задач, управление экспериментом и автономные лаборатории. Отдельно рассмотрены ограничения направления: зависимость от качества данных, проблема интерпретируемости результатов и риски воспроизводимости. Сформулированы условия, при которых предсказательная способность модели может быть преобразована в научное знание.

Текст статьи

Введение

Направление AI for Science за последнее десятилетие прошло путь от эффектных единичных результатов до самостоятельной исследовательской программы с собственной проблематикой, методологией и инфраструктурой. Предсказание пространственной структуры белков [1, с. 583-589], ускорение поиска новых кристаллических материалов, аппроксимация решений уравнений математической физики, управление плазмой в токамаке в режиме реального времени – во всех этих областях модели машинного обучения выполняют работу, которая прежде требовала либо дорогостоящего эксперимента, либо вычислений, недоступных даже суперкомпьютерам [2, с. 47-60].

Показательно, что интерес к теме возник не внутри информатики, а на её границе с естественными науками. Химик, биолог и физик обратились к машинному обучению не потому, что были очарованы новизной метода, а потому, что уперлись в неустранимое ограничение: пространство возможных молекул, кристаллических решёток или конфигураций поля настолько велико, что его нельзя обойти ни перебором, ни интуицией. Именно это обстоятельство – комбинаторный взрыв в пространстве гипотез – и составляет подлинную предпосылку направления.

Вместе с тем вокруг AI for Science накопился слой риторики, который заслуживает трезвого разбора. Утверждения об «автоматизации открытий» и «конце теории» звучат эффектно, но плохо согласуются с фактической практикой лабораторий. Цель настоящей статьи – отделить содержательное ядро направления от сопровождающего его шума: показать, какие именно этапы научного цикла ИИ действительно преобразует, какие оставляет нетронутыми и при каких условиях предсказательная способность модели превращается в научное знание, а не остаётся набором корректных, но необъяснённых чисел.

Смещение узкого места в научном цикле

Принципиально не ускорение само по себе. Меняется структура научного поиска. Классический цикл «гипотеза – эксперимент – проверка – уточнение теории» опирался на способность исследователя выдвигать правдоподобные предположения. Именно эта способность, а не вычислительная мощность, десятилетиями оставалась узким местом: перебрать миллион кандидатов было невозможно физически, и потому ценилось умение угадать те десять, которые стоит проверить. Научная интуиция, эрудиция, чувство красоты решения – всё это были не украшения профессии, а рабочие инструменты сужения пространства поиска.

Искусственный интеллект переносит перебор гипотез в вычислительную плоскость. Обученная на известных структурах модель способна оценить миллионы кандидатов за время, за которое исследователь успеет обдумать одного. Соответственно, дефицитным ресурсом становится другое – умение корректно поставить задачу и строго верифицировать полученный результат. Роль учёного не сокращается, а смещается: от генерации вариантов к формулировке вопросов и контролю качества ответов. Этот сдвиг заслуживает внимания, поскольку он перераспределяет ценность компетенций внутри научного коллектива, а не просто сокращает трудозатраты.

Из сказанного следует неочевидное наблюдение. Автоматизация наиболее эффективна там, где критерий успеха задан внешним и дешёвым в вычислении образом: энергия конфигурации, невязка уравнения, соответствие экспериментальному спектру. Там же, где критерий сам является предметом научного спора – например, при выборе объяснительной модели, – автоматизация буксует, поскольку ей нечего оптимизировать. Иначе говоря, ИИ хорошо решает задачи поиска и плохо – задачи целеполагания. Граница между этими двумя классами задач и есть реальная граница направления AI for Science.

Основные классы применений

Прежде чем перечислять области применения, полезно уточнить, что именно понимается под искусственным интеллектом в научном контексте. Речь идёт не о единой технологии, а о наборе методов, объединённых лишь общим свойством: они строят модель зависимости по данным, а не выводят её из первых принципов [10]. Это различие фундаментально. Классическая вычислительная наука движется от закона к следствию; методы машинного обучения – от наблюдения к обобщению. Соединение двух движений в одном исследовании и составляет содержание направления, а вовсе не подмена одного другим, как это иногда изображается в популярном изложении.

Первый и наиболее зрелый класс – суррогатное моделирование. Точный расчёт свойств вещества из первых принципов требует решения квантово-механических уравнений, стоимость которого растёт нелинейно с числом частиц. Обученная на результатах таких расчётов нейросетевая модель воспроизводит их с приемлемой точностью на порядки быстрее [9]. Здесь ИИ не заменяет физическую теорию, а служит её вычислительным продолжением: теория задаёт обучающую выборку, модель – интерполяцию внутри неё. Отсюда, кстати, и главное ограничение суррогатов: их надёжность резко падает за пределами области, покрытой обучающими данными, а именно там обычно и находятся интересные научные результаты.

Второй класс – решение обратных задач. Прямая задача (по структуре предсказать спектр) вычислительно проста; обратная (по спектру восстановить структуру) некорректна по Адамару и допускает множество решений. Методы машинного обучения, включая физически-информированные нейронные сети, встраивающие уравнения в функцию потерь [4, с. 686-707], позволяют регуляризовать такие задачи, ограничивая пространство решений известными физическими законами. Это направление представляется методологически наиболее здоровым: физика здесь не вытесняется статистикой, а задаёт ей рамки, в которых статистика допустима.

Третий класс – управление экспериментом. Наглядный пример: удержание конфигурации плазмы в термоядерной установке требует принятия решений в масштабе миллисекунд, что исключает участие человека и делает затруднительным применение классических регуляторов; обученные методом подкрепления агенты справляются с этой задачей [5, с. 414-419]. Здесь ИИ выступает уже не как инструмент анализа, а как элемент экспериментальной установки – что порождает отдельный вопрос о том, в какой мере результат такого эксперимента может считаться воспроизводимым, если поведение управляющего контура не поддаётся аналитическому описанию.

Четвёртый класс, наиболее обсуждаемый и наименее зрелый, – автономные лаборатории, замыкающие цикл «предсказание – синтез – измерение – переобучение» без участия человека. Концептуально это логическое завершение направления; практически же почти все известные реализации работают в узких предметных областях с хорошо стандартизованными протоколами. Сообщения об «открытии новых материалов роботом» требуют осторожного прочтения: масштабный вычислительный поиск способен предложить сотни тысяч термодинамически устойчивых кандидатов [3, с. 80-85], однако устойчивость на бумаге и синтезируемость в лаборатории – не одно и то же, и путь от первого ко второму по-прежнему проходит через человека.

Данные как ограничивающий фактор

Обсуждение AI for Science обычно концентрируется на моделях, тогда как реальным ограничителем выступают данные. Научные данные, в отличие от текстов или изображений, дороги, малочисленны и систематически смещены. Смещение возникает уже на уровне публикационной практики: отрицательные результаты – не удавшийся синтез, не подтвердившаяся реакция – публикуются редко, а значит, почти отсутствуют в обучающих выборках. Модель, обученная на литературе, усваивает не распределение реальности, а распределение того, что было принято к публикации. Различие между этими двумя распределениями невозможно оценить изнутри самой модели.

Второе обстоятельство – неоднородность форматов и метаданных. Значительная часть экспериментальных данных остаётся в лабораторных журналах, приложениях к статьям и приборных форматах, не приспособленных к машинному чтению. Инфраструктурная работа по приведению данных к пригодному для обучения виду по трудоёмкости сопоставима с самим исследованием, но воспринимается как техническая, а потому систематически недофинансируется и слабо вознаграждается академической системой стимулов. Здесь дефицит носит не алгоритмический, а институциональный характер.

Наконец, отдельного упоминания заслуживает риск замыкания контура. По мере того как всё большая доля публикуемых данных сама порождается моделями, обучение следующего поколения моделей на этом корпусе ведёт к постепенной деградации: распределение сужается, редкие события исчезают, модель всё увереннее воспроизводит собственные артефакты [8, с. 755-759]. Для науки этот сценарий опаснее, чем для генерации текстов, поскольку здесь ошибка не бросается в глаза – она маскируется формальной корректностью числа.

Интерпретируемость, воспроизводимость и граница знания

Отсюда следует и главный риск направления. Модель, обученная на данных, воспроизводит закономерности, но не объясняет их. Результат без интерпретации остаётся фактом, а не знанием. Разница здесь не терминологическая: знание отличается от факта переносимостью – способностью быть применённым к ситуации, не встречавшейся в обучении. Именно перенос, а не точность на отложенной выборке, является настоящим критерием научной ценности модели, и именно он хуже всего измеряется принятыми в машинном обучении метриками.

Отсюда вытекает практическое требование, которое, к сожалению, соблюдается непоследовательно: предсказание модели должно сопровождаться указанием области применимости и оценкой неопределённости. Модель, уверенно экстраполирующая за пределы обучающего распределения без всякого сигнала об этом, опаснее отсутствия модели, поскольку создаёт ложное основание для дорогостоящего эксперимента. Развитие методов, встраивающих в модель априорные знания предметной области, представляет собой попытку решить эту проблему конструктивно, ограничивая пространство возможных предсказаний физически допустимым [6, с. 2318-2331].

Не менее остро стоит вопрос воспроизводимости. Кризис воспроизводимости, обсуждаемый в естественных науках уже около десятилетия [7, с. 452-454], в вычислительных исследованиях приобретает специфическую форму: воспроизвести результат мешают не только недоступность данных и кода, но и стохастичность обучения, зависимость от версий библиотек, аппаратные особенности вычислений с плавающей точкой. Публикация статьи без обучающего кода, весов модели и точного описания процедуры валидации сегодня должна расцениваться так же, как публикация экспериментальной работы без описания методики.

Следует, впрочем, избегать и противоположной крайности – требования полной прозрачности как условия научной допустимости метода. История науки знает достаточно инструментов, работавших раньше, чем было построено их теоретическое обоснование: паровая машина предшествовала термодинамике, а не наоборот. Продуктивнее говорить не о прозрачности модели, а о проверяемости её выводов. Модель может оставаться чёрным ящиком, если её предсказания фальсифицируемы, а область применимости очерчена; и, напротив, формально интерпретируемая модель с необоснованной экстраполяцией научной ценности не имеет. Обнадёживающим здесь выглядит направление символьной регрессии, извлекающей из данных аналитические выражения, – оно возвращает результат в привычную для естествознания форму закона, пусть пока и на задачах ограниченной сложности.

Полезно провести различие между тремя уровнями результата. Первый – предсказание: модель указывает, что данное соединение вероятно обладает нужным свойством. Второй – подтверждение: предсказание проверено независимым экспериментом. Третий – объяснение: установлено, какой механизм обусловливает свойство, и это объяснение согласовано с существующей теорией. Направление AI for Science сегодня уверенно работает на первом уровне, всё чаще выходит на второй и почти не затрагивает третий. Утверждения о том, что ИИ «совершает открытия», как правило, смешивают первый уровень с третьим.

Заключение

Проведённый анализ позволяет сформулировать следующие выводы. Во-первых, вклад искусственного интеллекта в науку носит структурный, а не только количественный характер: перенося перебор гипотез в вычислительную плоскость, ИИ смещает узкое место научного цикла с генерации вариантов на постановку задачи и верификацию результата. Во-вторых, эффективность методов ИИ распределена в научном цикле крайне неравномерно – они сильны там, где критерий успеха вычислим, и бесполезны там, где сам критерий подлежит обсуждению. В-третьих, ограничивающим фактором развития направления выступают не алгоритмы, а данные и институциональная инфраструктура их подготовки.

Практическим следствием является требование к организации исследований: коллектив, применяющий методы машинного обучения в предметной области, должен включать как носителя предметной экспертизы, способного оценить физическую осмысленность результата, так и специалиста, понимающего границы применимости метода. Разделение этих ролей между разными коллективами, при котором одни поставляют данные, а другие – модели, систематически порождает работы, безупречные с точки зрения метрик и бессодержательные с точки зрения предметной науки. Институциональное преодоление этого разрыва представляется не менее важной задачей, чем совершенствование самих алгоритмов.

Зрелость AI for Science, таким образом, будет определяться не рекордами точности на эталонных наборах, а развитием методов интерпретации, количественной оценки неопределённости и обеспечения воспроизводимости – тем, что превращает предсказание в научное понимание. Ускорение перебора само по себе не является познанием; оно лишь освобождает исследователю время для той работы, которую по-прежнему невозможно делегировать, – для формулировки вопроса и для честного сомнения в полученном ответе.

Список литературы

  1. Jumper J. et al. Highly Accurate Protein Structure Prediction with AlphaFold // Nature. – 2021. – Vol. 596. – P. 583-589.
  2. Wang H. et al. Scientific Discovery in the Age of Artificial Intelligence // Nature. – 2023. – Vol. 620. – P. 47-60.
  3. Merchant A. et al. Scaling Deep Learning for Materials Discovery // Nature. – 2023. – Vol. 624. – P. 80-85.
  4. Raissi M., Perdikaris P., Karniadakis G. E. Physics-Informed Neural Networks: A Deep Learning Framework for Solving Forward and Inverse Problems Involving Nonlinear Partial Differential Equations // Journal of Computational Physics. – 2019. – Vol. 378. – P. 686-707.
  5. Degrave J. et al. Magnetic Control of Tokamak Plasmas through Deep Reinforcement Learning // Nature. – 2022. – Vol. 602. – P. 414-419.
  6. Karpatne A. et al. Theory-Guided Data Science: A New Paradigm for Scientific Discovery from Data // IEEE Transactions on Knowledge and Data Engineering. – 2017. – Vol. 29, No. 10. – P. 2318-2331.
  7. Baker M. 1500 Scientists Lift the Lid on Reproducibility // Nature. – 2016. – Vol. 533. – P. 452-454.
  8. Shumailov I. et al. AI Models Collapse when Trained on Recursively Generated Data // Nature. – 2024. – Vol. 631. – P. 755-759.
  9. Николенко С.И., Кадурин А.А., Архангельская Е.О. Глубокое обучение. – СПб.: Питер, 2018. – 480 с.
  10. Рассел С., Норвиг П. Искусственный интеллект: современный подход. 4-е изд. – М.: Вильямс, 2021. – 1136 с.

Поделиться

467
Обнаружили грубую ошибку (плагиат, фальсифицированные данные или иные нарушения научно-издательской этики)? Напишите письмо в редакцию журнала: info@apni.ru

Похожие статьи

Другие статьи из раздела «Информационные технологии»

Все статьи выпуска
Актуальные исследования

#35 (321)

Прием материалов

22 августа - 28 августа

осталось 2 дня

Размещение PDF-версии журнала

2 сентября

Размещение электронной версии статьи

сразу после оплаты

Рассылка печатных экземпляров

16 сентября