MXStat
MXStat
Введите текст для поиска
Расширенный поиск каналов
  • Вход на сайт
  • Каталог
    Каталог каналов Региональные подборки Поиск каналов
    Добавить канал
  • Рейтинги
    Рейтинг каналов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Max
Геолог-программист

25 Sep, 17:46

Открыть в Max Поделиться

Scispace\perplexity на коленке

С чего на самом деле начиналась история ИИ - ассистента?
На самом деле - первоначальная задумка - создать непосредственно помощника исследователя, аналогичного перечисленным в заголовке.

Как они работают?
Как правило - это некоторая большая языковая модель или ряд отдельных БЯМ вокруг которых есть разные инструменты - это всё объединяется в харнес-систему (harness - упряж), где множество агентов одновременно выполняют различные задачи.
Главная модель (как правило - самая большая) - является оркестратором, которая знает сильно больше других, и ряд маленьких - у них в контексте четкая задача и небольшой набор инструментов для них.
Например, вы отправляете запрос "Создай подборку статей про рудоносность золото‑сульфидных месторождений Восточной Сибири за последние 5 лет".
Оркестратор раскидывает задачу:
— один агент генерирует ряд запросов для поиска, вытаскивает DOI / аннотации, научные метаданные;
— второй шерстит открытые источники — eLibrary, КиберЛенинку, сайты институтов;
— третий собирает всё в единую таблицу: title, authors, year, url, relevance_score.
Дальше эта информация может разными способами векторизоваться\индексироваться и собираться в базу, с которой может работать другой агент.

Технический стек
Сама обвязка может состоять из разного, для конкретно нашей цели - нужен минимум RAG (Retrieval-Augmented Generation, генерация с поиском по базе) и, собственно, источники информации, которые должны базу заполнять, ну и технологический стек, основанный на российских технологиях, чтобы голова не болела.

С точки зрения индексации баз по науке существует несколько систем научного цитирования, colab.ws и РЦНИ. У того и у другого есть апи и вроде бы как оба доступны.
Ребятам из колаба можно написать в чат - быстро ответят и решат все вопросы, со вторыми сколько не пытался связаться, к сожалению, так и не получил ответа, при этом что отправлял несколько запросов с разных адресов.

Кроме научных баз - полезно собирать данные и статьи из интернета - для этого используется апи яндекса, оно доступное и достаточно бюджетное.
Ну и сама языковая модель - гигачат, на мой вкус - он отвечает лучше других с точки зрения русского языка и у них сразу есть модель для эмбедингов.

Результаты
В целом, система получилась более менее рабочей, но пока что сильно требовательно по ресурсам с точки зрения запросов - в тот же самый колаб может улетать до 100 запросов на поиск разной литературы. Также далеко не всегда можно скачать PDF, что усложняет создание базы для RAG и пока что требует частого вмешательства, ну и написание статей у меня пока не в приоритете, поэтому это больше остается экспериментом и интересным опытом.
Ну а что в приоритете - это вторая версия системы автоматического описания керна, про которую, наконец, скоро смогу рассказать много подробностей :)

geologistprogrammer | VK | TG

48 3
Каталог
Каталог каналов Подборки каналов Поиск каналов Добавить канал
Рейтинги
Рейтинг каналов Max
Контакты
Написать в Max Написать в Telegram Написать на почту
Всякая всячина
Пользовательское соглашение Политика конфиденциальности
Наши каналы
MXStat в Telegram MXStat в Max
Наши боты
MXAuthBot MXAnalyticsBot
Made by TGStat