Исследователи из Tencent и Пекинского университета Цзяотун представили PolyWorkBench — бенчмарк, предназначенный для оценки ИИ-агентов в многоязычных корпоративных задачах, включая локализацию.
Бенчмарк появился в тот момент, когда предприятия всё чаще ожидают от ИИ-агентов выполнения многоязычных бизнес-процессов, а не отдельных задач. Исследователи отмечают, что существующие многоязычные бенчмарки в основном оценивают перевод и понимание языка, в то время как агентные бенчмарки тестируют планирование и использование инструментов преимущественно на одном языке.
На практике корпоративные рабочие процессы часто требуют от ИИ-агентов работы на нескольких языках от начала до конца — интерпретации инструкций на одном языке, поиска информации на другом, использования внешних инструментов для обработки многоязычного контента и создания результатов на нескольких целевых языках.
01PolyWorkBench: оценка многоязычных рабочих процессов
Поскольку ИИ-агенты берут на себя всё больше сквозных бизнес-процессов, исследователи утверждают, что многоязычность должна оцениваться в рамках всего рабочего процесса, чтобы лучше отражать то, как ИИ используется в глобальных компаниях.
Для решения этой задачи они разработали PolyWorkBench — бенчмарк, состоящий из 67 вручную разработанных корпоративных задач в пяти областях: коммерция, интеллектуальная работа, юридический анализ, производство и локализация. Каждая задача представляет собой полный многоязычный бизнес-процесс, в котором агенты получают инструкции вместе с вспомогательными материалами — документами, электронными таблицами, контрактами или многоязычными ресурсами — и должны создавать результаты, соответствующие заранее определённым бизнес-требованиям.
В зависимости от задачи агентам может потребоваться извлекать информацию на разных языках, использовать внешние инструменты, объединять промежуточные результаты и создавать отчёты, электронные таблицы, юридические документы или результаты локализации.
Ключевая особенность дизайна заключается в том, что многоязычность встроена в весь рабочий процесс, а не рассматривается как отдельный этап перевода. По мере выполнения каждой задачи агенты должны сохранять смысл при переходе между языками в процессе промежуточных рассуждений и генерации конечного результата. По словам исследователей, это позволяет бенчмарку выявлять сбои, которые не могут уловить традиционные многоязычные и одноязычные агентные бенчмарки.
Бенчмарк охватывает десять языков — английский, китайский, японский, корейский, вьетнамский, русский, французский, испанский, немецкий и арабский — причём 88% задач включают три или более языка.
02Многоязычная производительность остаётся проблемой
Исследователи оценили ряд передовых моделей с открытым весом и обнаружили, что современные ИИ-агенты всё ещё испытывают трудности с многоязычными корпоративными рабочими процессами.
«Современные LLM-агенты испытывают значительное ухудшение производительности в многоязычных рабочих процессах, даже если они показывают высокие результаты на одноязычных бенчмарках с длинным горизонтом», — заявили они.
Результаты также показали, что производительность значительно варьируется как по бизнес-доменам, так и по языкам. Ни одна модель не показала стабильно лучших результатов во всех корпоративных рабочих процессах, а некоторые системы демонстрировали гораздо больший разрыв в производительности между языками, чем другие.
По словам исследователей, многоязычные агенты чаще всего терпели неудачу либо из-за неправильного понимания информации на исходном языке, либо из-за потери согласованности между исходным и целевым языками на нескольких этапах.
Локализация: многоязычность важнее долгосрочного планирования
В задачах локализации бенчмарка — которые включают многоязычную адаптацию программного обеспечения, документации, субтитров и маркетингового контента — исследователи обнаружили, что многоязычные способности имеют большее значение, чем сложное долгосрочное планирование.
«Задачи локализации вознаграждают сильные многоязычные базовые модели больше, чем долгосрочное планирование», — отметили исследователи.
Исследователи заявили, что бенчмарк предназначен для поддержки будущих исследований многоязычных ИИ-агентов, и планируют со временем расширить его, добавив новые языки, домены и корпоративные рабочие процессы.
Авторы: Хунлян Ли, Ицзинь Лю, Чживэй Чжан, Цзыхэ Лю, Синьюэ Лоу, Цзинань Сюй, Фаньдун Мэн и Кайюй Хуан.
Перевод и редакционная адаптация AIDF
Материал основан только на фактах из оригинальной публикации
Источник: How AI Agents Handle Multilingual Enterprise Workflows, Including Localization - Slator
