MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Цифровизация проектирования и стройки

22 Sep, 17:05

Открыть в Max Поделиться

В SIGNAL провели эксперимент — проверили один комплект ПД семи разными моделями в разных сценариях, в том числе и в их решении — AI Checker. Замечания затем вручную оценивал инженер.

Главный вопрос был не в том, сколько замечаний сгенерирует нейросеть, а сколько из них подтвердится, сколько существенных проблем она пропустит и насколько сократится объём ручной проверки.

Результаты прогонов:

🟩 GPT-6 Astra — 23 замечания, подтвердилось 21, найдено 13 из 14 контрольных дефектов, подтверждаемость около 91%.
🟩 Лучший прогон GPT-5.6 — 12 замечаний, подтвердились все, но из контрольного набора только 8 из 14.
🟩 Глубокий многоступенчатый анализ — 42 замечания, подтвердилось 31 (10,5 из 14 дефектов, подтверждаемость около 74%).
🟩 Локальная Qwen3-VL 8B — 47 замечаний, подтвердилось примерно одно (0,5 из 14 дефектов, подтверждаемость около 2%)

Отдельный вывод: количество замечаний почти ничего не говорит о качестве. Можно получить 47 замечаний с практически нулевой полезностью, а можно — 23, из которых 21 подтверждается. Поэтому важны четыре метрики: сколько реальных проблем найдено, сколько пропущено, сколько создано ложных замечаний и сколько времени инженера удалось сэкономить.

140 2
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat