В SIGNAL провели эксперимент — проверили один комплект ПД семи разными моделями в разных сценариях, в том числе и в их решении — AI Checker. Замечания затем вручную оценивал инженер.
Главный вопрос был не в том, сколько замечаний сгенерирует нейросеть, а сколько из них подтвердится, сколько существенных проблем она пропустит и насколько сократится объём ручной проверки.
Результаты прогонов:
🟩 GPT-6 Astra — 23 замечания, подтвердилось 21, найдено 13 из 14 контрольных дефектов, подтверждаемость около 91%.
🟩 Лучший прогон GPT-5.6 — 12 замечаний, подтвердились все, но из контрольного набора только 8 из 14.
🟩 Глубокий многоступенчатый анализ — 42 замечания, подтвердилось 31 (10,5 из 14 дефектов, подтверждаемость около 74%).
🟩 Локальная Qwen3-VL 8B — 47 замечаний, подтвердилось примерно одно (0,5 из 14 дефектов, подтверждаемость около 2%)
Отдельный вывод: количество замечаний почти ничего не говорит о качестве. Можно получить 47 замечаний с практически нулевой полезностью, а можно — 23, из которых 21 подтверждается. Поэтому важны четыре метрики: сколько реальных проблем найдено, сколько пропущено, сколько создано ложных замечаний и сколько времени инженера удалось сэкономить.
Главный вопрос был не в том, сколько замечаний сгенерирует нейросеть, а сколько из них подтвердится, сколько существенных проблем она пропустит и насколько сократится объём ручной проверки.
Результаты прогонов:
🟩 GPT-6 Astra — 23 замечания, подтвердилось 21, найдено 13 из 14 контрольных дефектов, подтверждаемость около 91%.
🟩 Лучший прогон GPT-5.6 — 12 замечаний, подтвердились все, но из контрольного набора только 8 из 14.
🟩 Глубокий многоступенчатый анализ — 42 замечания, подтвердилось 31 (10,5 из 14 дефектов, подтверждаемость около 74%).
🟩 Локальная Qwen3-VL 8B — 47 замечаний, подтвердилось примерно одно (0,5 из 14 дефектов, подтверждаемость около 2%)
Отдельный вывод: количество замечаний почти ничего не говорит о качестве. Можно получить 47 замечаний с практически нулевой полезностью, а можно — 23, из которых 21 подтверждается. Поэтому важны четыре метрики: сколько реальных проблем найдено, сколько пропущено, сколько создано ложных замечаний и сколько времени инженера удалось сэкономить.