CNY Бирж.11,59+0,35%CHKZ15 950-1,85%OKEY42,56+1,09%IMOEX2 193,18-1,07%RTSI885,59-1,07%RGBI114,3-0,14%RGBITR767,34-0,1%

Ускорение, точность и самокоррекция: ученые ФКН ВШЭ на международной конференции ICML-2026

Исследователи факультета компьютерных наук (ФКН) ВШЭ представили свои проекты в южнокорейском Сеуле на международной конференции по машинному обучению ICML 2026, одном из главных научных событий в своей области. Сразу несколько исследований сотрудников факультета были удостоены высокого статуса Spotlight.

Среди отмеченных работа Tensorion: A Tensor-Aware Generalization of the Muon Optimizer исследователей Научно-учебной лаборатории матричных и тензорных методов в машинном обучении Института искусственного интеллекта и цифровых наук ФКН ВШЭ. Авторы усовершенствовали популярный алгоритм Muon, научив его работать с более сложными, многомерными структурами данных — тензорами. Эта работа была одной из пяти, получивших статус Spotlight в рамках семинара, на котором были представлены 75 статей. «Для меня это был первый опыт выступления на международной конференции, и он оставил самые положительные впечатления, — рассказал Александр Моложавенко, стажер-исследователь лаборатории. — На самой конференции было огромное количество исследователей, в том числе работающих в близких нам областях. Было также очень приятно увидеть большое русскоязычное научное сообщество и завести новые профессиональные знакомства».

Еще одна работа, удостоенная статуса Spotlight, — статья On Efficient Scaling of GNNs via IO-Aware Layers Implementations исследователей из Научно-учебной лаборатории компании «Яндекс» ФКН ВШЭ. Здесь ученые сосредоточились на проблеме ускорения графовых нейронных сетей на современных графических процессорах.

Авторы отмечают, что существующие реализации таких нейросетей зачастую плохо оптимизированы. Чтобы решить эту проблему, они проанализировали несколько наиболее популярных архитектур и устранили узкие места индивидуально для каждой группы алгоритмов. В результате им удалось добиться кратного роста производительности и значительного снижения пикового потребления памяти. Например, для модели GATv2 скорость вычислений возросла почти в семь раз, а потребление памяти сократилось в сто раз.

Авторы уже выложили код в открытый доступ и надеются, что их подход даст толчок к дальнейшему повышению эффективности графовых нейросетей — по аналогии с тем масштабным развитием, которое ранее произошло с архитектурой трансформеров.

«Конференция была интересной прежде всего из-за высокой концентрации исследователей с общей целью — представлять свои работы, пообщаться с авторами вживую, поделиться опытом и наладить новые контакты. Мне кажется, главное в конференции — сам процесс нетворкинга. Общение по электронной почте или онлайн заметно отстает от личного», — считает Фёдор Великонивцев, младший научный сотрудник лаборатории «Яндекса» ФКН.

На конференции гораздо меньше предрассудков, и часто авторы более открыты к обсуждению своих работ, чем если бы они выступали с обычным докладом, подчеркнул он. «Так, например, мне удалось пообщаться на одном из митапов с Три Дао, выдающимся ученым в области эффективных вычислений на графических процессорах (Tri Dao — Chief Scientist в Together AI. — Ред.), которыми я сейчас и занимаюсь. Помимо этого, я познакомился со многими крутыми учеными из разных областей, а также встретился с зарубежными коллегами», — рассказал Фёдор Великонивцев.

Делегация Института искусственного интеллекта и цифровых наук ФКН ВШЭ представила сразу 16 научных работ, которые охватывают широкий спектр направлений — от фундаментальных проблем оптимизации и теории оптимального транспорта до прикладных задач генерации текста, изображений и молекулярного моделирования.

В исследовании Improved Stochastic Optimization of LogSumExp ученые решили проблему, которая мешает применять стохастические методы к целому классу задач — от оптимального транспорта до робастного обучения. В основе таких задач лежит функция LogSumExp, но ее точный расчет при большом количестве данных становится непомерно дорогим, а упрощенные замены дают ошибку. Ученые предложили новую аппроксимацию, которая сохраняет все важные математические свойства (выпуклость и гладкость) и при этом позволяет использовать быстрые стохастические градиентные методы практически без потери качества.

«Раньше оптимизация LogSumExp в задачах больших размерностей требовала чрезвычайно долгих вычислений. Можно было ускорить процесс за счет потери точности или вычислительной стабильности. Нам удалось устранить этот компромисс: предлагаемая аппроксимация обеспечивает высокую точность и устойчивость при быстрой сходимости, успешно решая задачи с сотнями тысяч слагаемых», — комментирует один из авторов статьи Егор Гладин, старший научный сотрудник Лаборатории теоретических основ моделей искусственного интеллекта.

В публикации Guided Star-Shaped Masked Diffusion исследователи переосмыслили работу диффузионных моделей, которые генерируют текст или код, последовательно выбирая токены. Их главный недостаток — необратимость: сделав неверный выбор на раннем шаге, модель не может его исправить. Новый алгоритм G-Star, основанный на «звездообразной» парадигме, позволяет возвращаться к ранним решениям и пересматривать их при появлении ошибок. Это важно для практических сценариев, где качество, скорость и стоимость ответа одинаково критичны. При этом метод можно добавить к уже существующим моделям без дорогостоящего переобучения.

«В классических дискретных диффузионных моделях каждый выбранный токен “замораживается”. Мы же предложили траекторию в виде “звезды”: все токены доступны для пересмотра на любом шаге, и модель может вернуться к любому раннему решению, если последующий контекст указывает на его ошибочность. Такая гибкость критически важна для генерации длинных связных текстов и программного кода, где одна ошибка в первом токене может разрушить всю логическую конструкцию. При этом наш метод требует лишь легкой донастройки одного слоя, что делает его практически применимым к уже существующим моделям», — пояснил Вячеслав Мещанинов, младший научный сотрудник Центра глубинного обучения и байесовских методов.

В публикации Your GFlowNet Secretly Learns an Optimal Transport Plan исследователи открыли неожиданную связь между генеративными потоковыми сетями (GFlowNets), которые пошагово строят дискретные объекты для таких задач, как дизайн молекул или комбинаторная оптимизация, и оптимальным транспортом — математическим аппаратом сравнения распределений с учетом геометрии пространства.

«Мы показали, что генеративные потоковые сети, изначально созданные для генерации объектов, по сути решают задачу оптимального транспорта на графе. Это неожиданный мост между двумя областями, который открывает новые возможности для масштабируемого решения транспортных задач на дискретных структурах, где традиционные методы неприменимы», — комментирует Ян Максимов, стажер-исследователь Центра глубинного обучения и байесовских методов.

На семинаре SPIGM в рамках конференции Кирилл Королёв, стажер-исследователь Международной лаборатории стохастических алгоритмов и анализа многомерных данных, вместе с командой представил исследование Stop the Sampler! Classifier-Based Adaptive Stopping for Sampling Kernels. Авторы предложили новый подход к генерации данных, при котором специальная обученная модель — классификатор — умеет вовремя останавливать вычислительный процесс. Это позволяет алгоритму избежать системных ошибок и существенно ускорить работу. Кроме того, команда усовершенствовала механизмы диффузионных моделей: теперь алгоритм может гибко распределять ресурсы, целенаправленно тратя больше вычислительных шагов на анализ только самых сложных участков данных.

«На конференции я сосредоточился на секциях по обучению с подкреплением, сэмплированию и вероятностным методам, где нашел несколько особенно интересных работ и новых идей. Помимо расширения научного кругозора, одной из главных целей таких поездок я считаю знакомство с исследователями, в том числе из своей области, обмен идеями и возможность рассказать о проектах нашей лаборатории», — говорит Кирилл Королёв.

Ученому особенно запомнилась секция по сэмплированию, где выступали многие ведущие исследователи в этой области, и с некоторыми из них ему удалось пообщаться лично. «Во время постерной сессии коллеги также поделились актуальными открытыми задачами и предложили несколько интересных направлений для дальнейших исследований», — отметил Кирилл Королёв.

Другая команда ученых этой же лаборатории представила постер Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech, где исследовала, как диффузионные модели могут эффективнее обрабатывать сложные данные на глубоком уровне. Авторы сфокусировались на «скрытом пространстве» нейросети — абстрактной среде, где ИИ представляет полученную информацию. В ходе исследования выяснилось, что метод кодирования FSQ (finite scalar quantization) выстраивает структуру этого пространства наиболее оптимальным образом для подобных архитектур. Чтобы показать жизнеспособность идеи в реальных условиях, исследователи успешно применили этот подход для задачи синтеза речи из текста.

Как отметила Таснима Садекова, стажер-исследователь Международной лаборатории стохастических алгоритмов и анализа многомерных данных ФКН, много работ на конференции было посвящено диффузионному языковому моделированию, вопросам интерпретируемости, мультимодальному анализу, агентным системам и совершенствованию методологий обучения больших языковых моделей. «Такое разнообразие обеспечило междисциплинарный обмен идеями, позволяя исследователям как находить интересное в области, так и выходить за рамки своей узкой специализации, — говорит Таснима Садекова. — Наряду с основной программой конференция предложила серию докладов, посвященных текущим вызовам отрасли. Мой интерес вызвал доклад о перспективах исследовательской работы в условиях стремительного прогресса технологий и агентных систем». Спикер — профессор Принстонского университета — выразил оптимизм и на ближайшее будущее отвел технологиям лишь роль вспомогательного инструмента, который сократит рутину программирования, позволив сосредоточиться на генерации идей. Приоритетной же задачей он видит разработку подходов к оценке новых компетенций в сфере ИИ.

Другие пресс-релизы