Может ли искусственный интеллект предложить алгоритм, который окажется лучше известного? В исследовании AlphaEvolve команда Google DeepMind соединила генерацию программ с автоматической проверкой. Разбираем подход, представленный 14 мая 2025 года.
Идея проходит испытание
Модели Gemini предлагают варианты программ. Затем система запускает их, проверяет результаты и выставляет оценки. Перспективные решения сохраняются и используются для следующего раунда поиска. Так возникает эволюционный цикл: предложение, испытание, отбор, новое предложение.
Подход особенно полезен там, где качество решения можно измерить автоматически: например, проверить корректность вычисления и сравнить скорость выполнения.
Что удалось получить
По данным DeepMind, AlphaEvolve нашла способ перемножать матрицы 4 × 4 с комплексными числами за 48 скалярных умножений. Авторы также сообщили о применении найденной эвристики в распределении задач дата-центров Google: она в среднем высвобождала 0,7% вычислительных ресурсов.
Это разные результаты: число арифметических операций в математическом алгоритме и эффективность конкретной производственной системы. Переносить эти показатели на любые программы или серверы было бы некорректно.
Что именно оценивает система
| Вопрос | Что нужно проверить |
|---|---|
| Решение правильное? | Соответствует ли результат условиям задачи и проверкам корректности. |
| Решение лучше? | По какой метрике сравнивали варианты: времени, ресурсам или числу операций. |
| Результат применим у нас? | Совпадают ли данные, оборудование и условия испытаний. |
Эта таблица — редакционная памятка, а не дополнительные результаты экспериментов DeepMind.
Почему проверка важнее уверенного ответа
Наш редакционный вывод: ценность подхода в сочетании генерации идей и измеримой обратной связи. Красиво написанный код ещё не означает, что программа работает правильно или быстрее. Испытания позволяют отделить обещание от результата.
Для исследовательского ИИ мало предложить интересную идею. Нужен способ проверить, что она действительно решает поставленную задачу.
Редакция human.by
При этом автоматическая оценка тоже требует внимания: исследователь задаёт условия, критерии и границы эксперимента. Если проверка не охватывает важный сценарий, хорошая оценка сама по себе не гарантирует полезность решения за пределами испытания.
