Агент сказал, что всё сделал. Верим? 🤔
ㅤ
Чтобы понять, действительно ли ИИ справился с поручением, команды AGI NLP и Computer Operator представили
WebPageBench — открытый бенчмарк для оценки работы веб-агентов на 152 повседневных задачах.
ㅤ
Агенты выполняют их на шести русскоязычных моках сайтов 👇
ㅤ
Так можно отделить ошибки в понимании задания от проблем с конкретной реализацией интерфейса. Большинство существующих бенчмарков использует англоязычные интерфейсы, тогда как WebPageBench работает с русскоязычными 🔥
ㅤ
Все действия агента сайт записывает в лог событий. По нему система определяет, была ли задача выполнена успешно.
ㅤ
WebPageBench также проверяет, как агент справляется с разными реализациями одного и того же элемента интерфейса, например календаря, счётчика или выпадающего списка.
ㅤ
В публичном лидерборде
уже 24 связки моделей и обвязок. Проект находится в открытом доступе, его можно запустить локально и добавить собственную модель или обвязку.
ㅤ
ㅤ
Чтобы понять, действительно ли ИИ справился с поручением, команды AGI NLP и Computer Operator представили
WebPageBench — открытый бенчмарк для оценки работы веб-агентов на 152 повседневных задачах.
ㅤ
Агенты выполняют их на шести русскоязычных моках сайтов 👇
ㅤ
• Покупают товарыㅤ
• Бронируют отели
• Ищут билеты
• Работают с файлами и корзиной
Так можно отделить ошибки в понимании задания от проблем с конкретной реализацией интерфейса. Большинство существующих бенчмарков использует англоязычные интерфейсы, тогда как WebPageBench работает с русскоязычными 🔥
ㅤ
Все действия агента сайт записывает в лог событий. По нему система определяет, была ли задача выполнена успешно.
ㅤ
Ждать отмашки от самого агента или использовать LLM-судью не нужно.ㅤ
WebPageBench также проверяет, как агент справляется с разными реализациями одного и того же элемента интерфейса, например календаря, счётчика или выпадающего списка.
ㅤ
В публичном лидерборде
уже 24 связки моделей и обвязок. Проект находится в открытом доступе, его можно запустить локально и добавить собственную модель или обвязку.
ㅤ
Код и инструкции — на GitHub