MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Sber AI

3 Oct, 12:01

Открыть в Max Поделиться

Агент сказал, что всё сделал. Верим? 🤔
ㅤ
Чтобы понять, действительно ли ИИ справился с поручением, команды AGI NLP и Computer Operator представили
WebPageBench — открытый бенчмарк для оценки работы веб-агентов на 152 повседневных задачах.
ㅤ
Агенты выполняют их на шести русскоязычных моках сайтов 👇
ㅤ
• Покупают товары
• Бронируют отели
• Ищут билеты
• Работают с файлами и корзиной
ㅤ
Так можно отделить ошибки в понимании задания от проблем с конкретной реализацией интерфейса. Большинство существующих бенчмарков использует англоязычные интерфейсы, тогда как WebPageBench работает с русскоязычными 🔥
ㅤ
Все действия агента сайт записывает в лог событий. По нему система определяет, была ли задача выполнена успешно.
ㅤ
Ждать отмашки от самого агента или использовать LLM-судью не нужно.
ㅤ
WebPageBench также проверяет, как агент справляется с разными реализациями одного и того же элемента интерфейса, например календаря, счётчика или выпадающего списка.
ㅤ
В публичном лидерборде
уже 24 связки моделей и обвязок. Проект находится в открытом доступе, его можно запустить локально и добавить собственную модель или обвязку.
ㅤ
Код и инструкции — на GitHub

519 6
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat