Как ИИ-агенты обрабатывают многоязычные корпоративные рабочие процессы | AIDF — AIDF Blog
LIVE · ENTRY 0001-A · AIDF draft / 5 МИН 2 SECTIONS · AUTHOR AT
Все материалы

Как ИИ-агенты обрабатывают многоязычные корпоративные рабочие процессы, включая локализацию

Исследователи из Tencent и Пекинского университета Цзяотун представили PolyWorkBench — бенчмарк для оценки ИИ-агентов в многоязычных корпоративных задачах, включая локализацию.

FIG.00 / COVER
How AI Agents Handle Multilingual Enterpri
42.6071°N
23.0470°E
Как ИИ-агенты обрабатывают многоязычные корпоративные рабочие процессы, включая локализацию

Исследователи из Tencent и Пекинского университета Цзяотун представили PolyWorkBench — бенчмарк, предназначенный для оценки ИИ-агентов в многоязычных корпоративных задачах, включая локализацию.

Бенчмарк появился в тот момент, когда предприятия всё чаще ожидают от ИИ-агентов выполнения многоязычных бизнес-процессов, а не отдельных задач. Исследователи отмечают, что существующие многоязычные бенчмарки в основном оценивают перевод и понимание языка, в то время как агентные бенчмарки тестируют планирование и использование инструментов преимущественно на одном языке.

На практике корпоративные рабочие процессы часто требуют от ИИ-агентов работы на нескольких языках от начала до конца — интерпретации инструкций на одном языке, поиска информации на другом, использования внешних инструментов для обработки многоязычного контента и создания результатов на нескольких целевых языках.

01PolyWorkBench: оценка многоязычных рабочих процессов

Поскольку ИИ-агенты берут на себя всё больше сквозных бизнес-процессов, исследователи утверждают, что многоязычность должна оцениваться в рамках всего рабочего процесса, чтобы лучше отражать то, как ИИ используется в глобальных компаниях.

Для решения этой задачи они разработали PolyWorkBench — бенчмарк, состоящий из 67 вручную разработанных корпоративных задач в пяти областях: коммерция, интеллектуальная работа, юридический анализ, производство и локализация. Каждая задача представляет собой полный многоязычный бизнес-процесс, в котором агенты получают инструкции вместе с вспомогательными материалами — документами, электронными таблицами, контрактами или многоязычными ресурсами — и должны создавать результаты, соответствующие заранее определённым бизнес-требованиям.

В зависимости от задачи агентам может потребоваться извлекать информацию на разных языках, использовать внешние инструменты, объединять промежуточные результаты и создавать отчёты, электронные таблицы, юридические документы или результаты локализации.

Ключевая особенность дизайна заключается в том, что многоязычность встроена в весь рабочий процесс, а не рассматривается как отдельный этап перевода. По мере выполнения каждой задачи агенты должны сохранять смысл при переходе между языками в процессе промежуточных рассуждений и генерации конечного результата. По словам исследователей, это позволяет бенчмарку выявлять сбои, которые не могут уловить традиционные многоязычные и одноязычные агентные бенчмарки.

Бенчмарк охватывает десять языков — английский, китайский, японский, корейский, вьетнамский, русский, французский, испанский, немецкий и арабский — причём 88% задач включают три или более языка.

02Многоязычная производительность остаётся проблемой

Исследователи оценили ряд передовых моделей с открытым весом и обнаружили, что современные ИИ-агенты всё ещё испытывают трудности с многоязычными корпоративными рабочими процессами.

«Современные LLM-агенты испытывают значительное ухудшение производительности в многоязычных рабочих процессах, даже если они показывают высокие результаты на одноязычных бенчмарках с длинным горизонтом», — заявили они.

Результаты также показали, что производительность значительно варьируется как по бизнес-доменам, так и по языкам. Ни одна модель не показала стабильно лучших результатов во всех корпоративных рабочих процессах, а некоторые системы демонстрировали гораздо больший разрыв в производительности между языками, чем другие.

По словам исследователей, многоязычные агенты чаще всего терпели неудачу либо из-за неправильного понимания информации на исходном языке, либо из-за потери согласованности между исходным и целевым языками на нескольких этапах.

Локализация: многоязычность важнее долгосрочного планирования

В задачах локализации бенчмарка — которые включают многоязычную адаптацию программного обеспечения, документации, субтитров и маркетингового контента — исследователи обнаружили, что многоязычные способности имеют большее значение, чем сложное долгосрочное планирование.

«Задачи локализации вознаграждают сильные многоязычные базовые модели больше, чем долгосрочное планирование», — отметили исследователи.

Исследователи заявили, что бенчмарк предназначен для поддержки будущих исследований многоязычных ИИ-агентов, и планируют со временем расширить его, добавив новые языки, домены и корпоративные рабочие процессы.

Авторы: Хунлян Ли, Ицзинь Лю, Чживэй Чжан, Цзыхэ Лю, Синьюэ Лоу, Цзинань Сюй, Фаньдун Мэн и Кайюй Хуан.

Перевод и редакционная адаптация AIDF

Материал основан только на фактах из оригинальной публикации

Источник: How AI Agents Handle Multilingual Enterprise Workflows, Including Localization - Slator

Ссылки из исходного материала:
AT
AIDF Team

Источник: How AI Agents Handle Multilingual Enterprise Workflows, Including Localization - Slator

Contact