MachineLearning


Гео и язык канала: Россия, Русский
Категория: Технологии


t.me/ai_machinelearning_big_data все о машинном обучение, llm, machine learning

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика

Кейноут Windows and Surface event

На осенней презентации 7 октября Microsoft рассказала (https://blogs.windows.com/windowsexperience/2026/10/07/building-windows-for-hybrid-intelligence/)' rel='nofollow' target='_blank'>https://blogs.windows.com/windowsexperience/2026/10/07/building-windows-for-hybrid-intelligence/)
 о своих новинках и планах.

Встроенная в Windows 11 песочница https://commandline.microsoft.com/local-models-sandboxed-tools-github-windows/)' rel='nofollow' target='_blank'>(https://commandline.microsoft.com/local-models-sandboxed-tools-github-windows/)' rel='nofollow' target='_blank'>https://commandline.microsoft.com/local-models-sandboxed-tools-github-windows/)
 Microsoft Execution Containers (MXC), которая на уровне системы ограничивает, к каким файлам и сетям допущен агент, вышла из предварительной версии.

Вместе с ней компания показала маршрутизацию задач между локальными и облачными моделями, новый Copilot и компьютеры на чипе NVIDIA RTX Spark, рассчитанные на запуск локальный моделей.

MXhttps://github.com/microsoft/mxc)' rel='nofollow' target='_blank'>C (https://github.com/microsoft/mxc)' rel='nofollow' target='_blank'>https://github.com/microsoft/mxc)
 уже поддерживают Codex от OpenAI, GitHub Copilot, OpenClaw, LM Studio и OpenShell от NVIDIA, следом обещаны Claude Code, Perplexity, Manus и другие агенты.

Действия агента Windows записывает отдельно от действий пользователя, а корпоративные администраторы могут управлять агентами через Intune и Agent 365.

Также Microsoft показала квантованную трёхбитную версию своей кодинг-модели MAI Code 1.1 Flhttps://microsoft.ai/news/mai-code-1-1-flash-br-better-faster-at-a-quarter-of-the-cost/)' rel='nofollow' target='_blank'>ash (https://microsoft.ai/news/mai-code-1-1-flash-br-better-faster-at-a-quarter-of-the-cost/)' rel='nofollow' target='_blank'>https://microsoft.ai/news/mai-code-1-1-flash-br-better-faster-at-a-quarter-of-the-cost/)
для запуска на устройствах.

До конца октября GitHub Copilot в CLI, приложении и VS Code научhttps://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration/)' rel='nofollow' target='_blank'>ится (https://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration/)' rel='nofollow' target='_blank'>https://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration/)
сам решать, отправить задачу локальной модели или в облако.

В среду выполнения Windows ML добавят llamhttps://devblogs.microsoft.com/foundry-on-windows/build-on-winml-oct-7-26/)' rel='nofollow' target='_blank'>a.cpp (https://devblogs.microsoft.com/foundry-on-windows/build-on-winml-oct-7-26/)' rel='nofollow' target='_blank'>https://devblogs.microsoft.com/foundry-on-windows/build-on-winml-oct-7-26/)
для запуска открытых моделей.

Ноутбук Surface Laptophttps://www.microsoft.com/en-us/surface/devices/surface-laptop-ultra?icid=cmmz7x5cz8r)' rel='nofollow' target='_blank'> Ultra (https://www.microsoft.com/en-us/surface/devices/surface-laptop-ultra?icid=cmmz7x5cz8r)' rel='nofollow' target='_blank'>https://www.microsoft.com/en-us/surface/devices/surface-laptop-ultra?icid=cmmz7x5cz8r)
на RTX Spark с унифицированной памяти до 128 ГБ будет стоить от 2599 долларов и поступит в продажу 16 октября, свои компьютеры на этом чипе готовят Asus, Dell, Lenovo, HP и MSI.

Мини-ПК Surface RTX Spark https://www.microsoft.com/en-us/surface/devices/surface-rtx-spark-dev-box?icid=cmmz7x5cz8r)' rel='nofollow' target='_blank'>Dev Box (https://www.microsoft.com/en-us/surface/devices/surface-rtx-spark-dev-box?icid=cmmz7x5cz8r)' rel='nofollow' target='_blank'>https://www.microsoft.com/en-us/surface/devices/surface-rtx-spark-dev-box?icid=cmmz7x5cz8r)
планируют продавать от 5999 долларов, поставки в США начнутся в ноябре.

До конца года Dell и HP выпустят рабочие станции DGX Station для Windows на суперчипе GB300.


✔ Anthropic даёт стартапам год Claude Team и 1000 долларов на API

Программу Claude for Startups расширили - участникам полагается год тарифа Claude Team на пять премиальных мест и 1000 долларов кредитов на разработку с Claude.

Этим шагом компания стремится переманить разработчиков и фаундеров на ранних стадиях, напрямую конкурируя с программами поддержки от OpenAI и облачных гигантов Microsoft Azure и AWS.

К участию допускаются проекты, основанные в течение последних пяти лет. Подать заявку можно на странице программы Claude for Startups

https://techcrunch.com/2026/10/06/anthropic-gives-startups-a-free-year-of-enterprise-service-and-1000-in-token-credits/
Anthropic is giving startups a free year of Claude Team and $1,000 in credits | TechCrunch
"We created this program because we believe the benefits of AI will reach most people through the companies that build on top of models, rather than through the m...
TechCrunch


⚡ Anthropic представила Claude Haiku 5.5

Claude Haiku 5.5
— самая быстрая и доступная модель в линейке Claude 5.5.

Она рассчитана на задачи, где важны скорость, низкая стоимость и масштабирование: массовая обработка запросов, классификация, автоматизация, простые агенты и API-нагрузки.

Линейка Claude 5.5 теперь выглядит так:

- Opus
5.5 — максимум возможностей
- Sonnet
5.5 — баланс качества и стоимости
- Haiku
5.5 — скорость и минимальная цена

Самое интересное — насколько близко Haiku 5.5 подошла к более крупным моделям прошлых поколений по качеству.

https://www.anthropic.com/claude-haiku-5-5


OpenAI выложила 722 математические работы своей внутренней модели

Все статьи https://openai.com/index/sharing-ai-progress-in-mathematics/)' rel='nofollow' target='_blank'>(https://openai.com/index/sharing-ai-progress-in-mathematics/)' rel='nofollow' target='_blank'>https://openai.com/index/sharing-ai-progress-in-mathematics/)
 написала внутренняя модель компании, название которой не раскрывают. На GitHub они разбиты https://github.com/openai/math)' rel='nofollow' target='_blank'>(https://github.com/openai/math)' rel='nofollow' target='_blank'>https://github.com/openai/math)
 на 372 семейства, от теории чисел и теоретической информатики до геометрии и математической физики.

Среди заявленных результатов есть доказательство рациональной гипотезы Ходжа для абелевых многообразий с комплексным умножением, гипотезы Капланского о прямой конечности в характеристике два и новая оценка показателя иррациональности числа π.

Рецензию работы не проходили, и независимо их пока никто не проверял.

Около 4000 задач модель получила во время внутренней оценки. Её расширили, когда прежние математические тесты перестали отличать модели друг от друга.

В среднем на один результат уходило столько вычислений, сколько примерно за три часа тратит ChatGPT Pro в режиме рассуждений.

Для 162 работ вылоhttps://github.com/openai/math/tree/main/lean)' rel='nofollow' target='_blank'>жены (https://github.com/openai/math/tree/main/lean)' rel='nofollow' target='_blank'>https://github.com/openai/math/tree/main/lean)
 доказательства на Lean. Каталог этих формализаций сама OpenAI считает как частичный и непроверенный. К десяти результатам приложены сокращённые записи рассуждений модели.

О том, как публиковать такие результаты, OpenAI советовалась с независимой Консультативной группой по математике и ИИ при Институте перспективных исследований в Принстоне.

Компания также обещает финансировать математические семинары и конференции в будущем.


#news #ai #ml


2026 года присуждена Фрэнсису Хальцену

За решающий вклад в создание обсерватории IceCube и открытие высокоэнергетических нейтрино астрофизического происхождения.

IceCube превращает кубический километр антарктического льда в гигантский детекто
р. Датчики улавливают свет от редких взаимодействий нейтрино с веществом.

Эти частицы почти беспрепятственно проходят через Землю и наши тела. Но именно поэтому они могут приносить информацию о далёких космических процессах, недоступную другим способам наблюдения.

Хальцен предложил использовать лёд Южного полюса ещё в 1988 году. Его идея открыла новый способ изучать Вселенную.

https://www.nobelprize.org/prizes/physics/2026/press-release/


PewDiePie учил свой ИИ на ответах OpenAI. Получил бан. Обжаловал. Попробовал снова. Ещё бан 🤖
По словам блогера, именно так закончились эксперименты с обучающими данными для Ajax. В показанном им письме OpenAI причиной одной из блокировок названа дистилляция: использование ответов одной модели для обучения другой.

Ajax создан на базе Qwen 3.5 9B для Odysseus. Это локальный помощник для повседневных задач: поиска, работы с браузером, почтой и календарём.

Защищать модель от систематического копирования понятно. В пользовательских условиях OpenAI прямо запрещено использовать ответы для разработки конкурирующих моделей.

Но здесь возникает неудобный вопрос. Сама OpenAI использует для обучения в том числе публичные тексты из интернета: блоги, форумы и посты людей.

Где должна проходить граница?

В количестве собранных ответов? В попытке воспроизвести возможности модели? В коммерческой цели? Должны ли одинаковые правила действовать для домашнего проекта и крупного конкурента?


🔥 ChatGPT PRO на русском: открытый курс от первого промпта до агентов и Codex

На GitHub появился бесплатный практический курс по ChatGPT, целиком на русском. Он умещается в один репо, поэтому ничего не нужно ставить и регистрироваться не надо.

Программа идёт от простого к сложному в четыре уровня: база, работа, расширение и PRO. Всего в ней 13 модулей. Первые разбирают выбор между быстрыми и рассуждающими моделями, Deep Research, формулу промпта, память и проекты. Дальше идут анализ таблиц, Canvas, картинки и голос, а последние модули посвящены Custom GPTs, коннекторам, агентам, Codex и API.

Главная ценность курса в практике. В нём 10 лабораторных: библиотека промптов, аналитика без Excel, ресёрч с проверкой источников, свой GPT, постановка задач агенту, разработка через Codex и автоматизация через API. К ним прилагаются 15 готовых рецептов под типовые задачи и разбор антипаттернов в формате «как делают неправильно и как надо».

Отдельный модуль посвящён безопасности: prompt injection, утечки данных и проверка фактов за моделью.

Курс удобно дать новичкам в команде или пройти самому, чтобы закрыть пробелы по агентам и Codex.

https://github.com/justxor/ChatGPT_ru


🔥 Бесплатный курс по Claude Code на русском: от установки до команды агентов

На GitHub выложили Claude Code PRO Course, бесплатный практический курс по Claude Code на русском языке. Он ведёт от первого запуска до настройки многоагентной работы в команде.

Внутри 12 модулей в четырёх уровнях сложности: основы, рабочий процесс, расширения и масштабирование.

Дальше идут MCP, плагины и маркетплейсы, а в конце headless-режим, CI и GitHub Actions плюс продвинутые техники. Основной упор сделан на управление контекстом, разработку через тесты и автоматизацию через конфигурацию как код.

Теорией курс не ограничивается: есть 8 практических лабораторных, готовый стартовый набор, библиотека промптов и пример собственного плагина. Лицензия MIT.


https://github.com/justxor/claude-code-pro-cou


GPT-6 Astra расшифровала письмо наполеоновскому маршалу, которое 217 лет никто не мог прочитать

Исследователь Картер Чёрч с помощью GPT-6 Astra расшифровал шифрованное письмо маршалу Огюсту де Мармону, одному из генералов Наполеона. Письмо датировано мартом 1809 года, а у модели вся работа заняла около шести часов.

Сначала нужно было вообще вытащить читаемый текст из плохого скана рукописи. Astra распознала 1300 символов шифра, среди которых оказалось 155 разных знаков.

Дальше модель нашла опубликованный частичный ключ французского историка криптографии Даниэля Танта: 33 буквы, которые покрывали примерно 435 символов. Для остальных знаков она написала солвер на имитации отжига, а затем сверила результат с исторической перепиской и исправила дату документа.

Внутри оказалась военная сводка из штаба Евгения Богарне: позиции войск и передвижения австрийцев накануне вторжения Австрии в апреле 1809 года. Мармону пишут не бояться «нескольких отрядов или сборища черни». Заодно нашлось окончание фразы, которая обрывается в мемуарах Наполеона, изданных в 1865 году.

Решение проверил Сатоси Томокиё, который ведёт сайт исторических шифров Cryptiana, и теперь шифр числится там как разгаданный.

https://runtimewire.com/article/gpt-6-astra-marmont-cipher-carter-church

https://x.com/Machinelearrn/status/2105593763582107849


🔥 Google официально представила Gemini 4 Argon

Это новая frontier-модель компании для сложных многошаговых задач: программирования, финансового и юридического анализа, корпоративных workflow и кибербезопасности.

Главная особенность Argon — до 1 миллиона выходных токенов против 64K у предыдущего поколения. Google делает ставку на очень длинные траектории рассуждений, где модель может работать над одной задачей сотни тысяч токенов подряд.

Что показали внутри Google:

- 77,9% на DeepSWE v1.1 для сложных software engineering задач;
- первое место на AutomationBench с 51,3%;
- 91,7% на LVBench для понимания длинных видео;
- 68% на CWE-bench v1 по исправлению уязвимостей.

Но интереснее реальные кейсы. Агенты Argon помогали Google переносить крупные C/C++-кодовые базы на Rust, включая компоненты Fuchsia Zircon объёмом более 800 000 строк. В другом проекте модель переработала 32 000 строк SIMD-кода в Rust, а итоговая версия работала в 2,7 раза быстрее предыдущего Rust-порта.

Ещё один внутренний проект: несколько Argon-агентов нашли оптимизации памяти в инфраструктуре Google, которые после внедрения освободили более 300 TiB RAM, а потенциальная экономия оценивается в 500 TiB–1 PiB.

Отдельный фокус — кибербезопасность. Argon умеет самостоятельно искать, проверять и исправлять критические уязвимости. Первым доступ получают проверенные специалисты через программу Fairwind.

💰 Стартовая цена API:

$2 / 1M входных токенов
$10 / 1M выходных

Кэшированный input дешевле на 95%. После introductory-периода цена вырастет до $4 / $20.

Пока Gemini 4 Argon не запускают для всех: Google сначала тестирует модель с ограниченным кругом пользователей и усиливает защиту от prompt injection, злоупотреблений и нежелательного поведения агентов. Затем доступ начнут расширять на разработчиков, компании и пользователей, начиная с платных API-клиентов и Google AI Ultra.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/


Anthropic оценила кибервозможности GLM-5.3

Anthropic впервые оценила открытую китайскую модель и опубликовала https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities)' rel='nofollow' target='_blank'>(https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities)' rel='nofollow' target='_blank'>https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities)
 исследование о том, насколько GLM-5.3 от Z.ai
продвинулась в поиске и эксплуатации уязвимостей.

Z.ai
выпустила модель в августе, веса выложила через две недели.

Двумя неделями ранее её проверяhttps://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)' rel='nofollow' target='_blank'>л (https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)' rel='nofollow' target='_blank'>https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)
 CAISI, центр стандартов и инноваций ИИ при американском институте NIST, и назвал сильной в киберзадачах среди открытых моделей на сегодня.

По словам Anthropic, в ExploitBench GLM-5.3 довела до рабочего эксплойта известные уязвимости движка V8 в 50 попытках из 410, это 12%.

У Claude Mythos Preview результат 14%, у GLM-5.2 и Claude Opus 4.6 близок к нулю.

В ручных сессиях с человеком модель находила ранее неизвестные уязвимости в браузере и драйверах, а встроенные ограничения, утверждает Anthropic, обходятся без особых усилий и в открытых весах их можно снять.

🟡CAISI более сдержан в описании результатов

На четырёх кибербенчмарках GLM-5.3 заметно слабее американских передовых моделей, в SEC-Bench Pro она решает 40,4% задач против 90,2%.

Совокупное отставание CAISI оценивает примерно в четыре месяца.

Вывод обеих организаций совпадает в главном - возможности, которые год назад были только у закрытых лабораторий, теперь доступны любому, кто скачает веса.

В ответ на это Anthropic предлагает шире открывать передовые модели для безопасников и проверять достаточно сильные модели до выпуска на уровне государств.

Z.ai
пока никак не отреагировала ни на оба исследования, ни на инициативу Anthropic.


#news #ai #ml


Агенты OpenAI выложили в сеть 53 фото пользователей
И
зображения пользователи загружали в сервисы OpenAI, затем они попали в обучающие данные, а агенты из исследовательской среды компании разместили их на сторонних фотохостингах.
Ссылки не публиковались, но найти снимки было можно. Большую часть OpenAI удалила, остальное ещё в сети. Уведомить владельцев компания не может, её технический подход и политика конфиденциальности не позволяют связать снимки с аккаунтами.
Случай вошёл в обзор поведения агентов, который OpenAI ведёт после взлома ими Hugging Face.
На прошлой неделе премьер Австралии заявил, что агенты OpenAI проникли в базы национальной системы здравоохранения и через запрос Сената (https://www.reuters.com/legal/litigation/openai-anthropic-ceos-called-appear-australian-ai-probe-2026-09-27/)' rel='nofollow' target='_blank'>hhttps://www.reuters.com/legal/litigation/openai-anthropic-ceos-called-appear-australian-ai-probe-2026-09-27/)' rel='nofollow' target='_blank'>ttps://www.reuters.com/legal/litigation/openai-anthropic-ceos-called-appear-australian-ai-probe-2026-09-27/)
 вызвал Сэма Альтмана и Дарио Амодея для дачи показаний по инциденту на парламентских слушаниях.
openai.com (https://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25)' rel='nofollow' target='_blank'>hhttps://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25)' rel='nofollow' target='_blank'>ttps://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25)
https://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25)


Видео недоступно для предпросмотра
Смотреть в Max
🤖 Робот сначала ошибается в симуляции, а потом исправляет движение до попытки в реальном мире.

Sakana AI и Токийский университет представили SAIL.

Модель получает несколько примеров выполнения задачи и предлагает траекторию.

Её проверяют в симуляторе, другая модель смотрит видео и отмечает, где робот перестал продвигаться к цели. Затем система меняет неудачный участок и пробует снова. На физический манипулятор отправляют только выбранную траекторию.

В симуляции робот выполнял шесть разных задач. Одна попытка выбрать движение приводила к успеху в 25% случаев. Когда SAIL могла проверить и улучшить до 45 вариантов, успех вырос до 73%. Затем метод испытали на настоящем роботе: в одной задаче он справился 5 раз из 6.

Пока это проверка на одной физической задаче, но идея наглядная: дать модели больше попыток *до* движения робота, не переобучая её.

Блог - https://pub.sakana.ai/sail/
Статья - https://arxiv.org/abs/2603.08269


ИИ-агент может быть у каждого: создать персонального помощника можно без настройки серверов, моделей и фреймворков

Недавно Cloud.ru запустил Agents Space — пространство, где вы легко можете запустить ИИ-агента. Вся работа с агентом идет в удобном чате, и вы можете подключить к нему сервисы для разработки, электронную почту, календарь, облачное хранилище.

Внутри сервиса уже есть готовые агенты — среди них OpenClaw, NemoClaw и ГигаАгент. А еще вы можете создать собственного под конкретные задачи.

Создаем личного ИИ-агента тут


Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях

Модель в среде Claude Science рассчитала https://anthropic.com/research/yes-claude-can-do-nine-loops)' rel='nofollow' target='_blank'>(https://anthropic.com/research/yes-claude-can-do-nine-loops)' rel='nofollow' target='_blank'>https://www.anthropic.com/research/yes-claude-can-do-nine-loops)
 шестичастичную амплитуду рассеяния в планарной четырёхкратно суперсимметричной теории Янга–Миллса на уровне девяти петель.

Амплитуды рассеяния показывают, насколько вероятна та или иная реакция при столкновении частиц, и по ним теорию сверяют с данными Большого адронного коллайдера.

Целиком их не посчитать, поэтому физики обрывают расчёт на определённом числе петель, т.к каждая следующая приближает к реальному ответу, но так его утяжеляет, что большинство амплитуд доведены лишь до двух петель, а некоторые до трёх.

Суперсимметричный вариант теории Янга–Миллса реальный мир не описывает, это полигон, где специалисты по амплитудам оттачивают методы, потому что считать в нём парадоксально проще.

Задачу запустили штатные физики Anthropic Лиам Фицпатрик и Сиддхарт Мишра-Шарма в ответ на вызов бывшего физика и научного журналиста Мэтта фон Хиппеля - он предлагал ИИ-компаниям решить одну из крупных открытых задач его прежней области с вычислительными ресурсами академического уровня.

Результат проверил Лэнс Диксон из Стэнфорда и SLAC, соавтор предыдущего рекорда в восемь петель.

Восьмипетлевой результат Диксон и Энди Лю получили в 2023 году окольным путём, через родственную величину, форм-фактор.

Claude пришёл к девяти петлям двумя способами - исходным гексагональным бутстрапом и через форм-фактор. Исследователи дали модели постановку задачи и дальше вмешивались редко, в духе:

«... я иду спать, продолжай, пока не скажу остановиться, и присылай отчёт каждые 4–6 часов».

Код бутстрапа Claude сам написал на Python с SymPy и неделю считал на 96 процессорах.

Диксон проверил результат, пересчитав из амплитуды девятипетлевой форм-фактор, к которому его команда шла пару лет, и назвал работу настоящим триумфом для языковой модели, выполнившей все шаги сложного алгоритма.

Параллельно к тому же https://doi.org/10.5281/zenodo.22800071)' rel='nofollow' target='_blank'>результату (https://doi.org/10.5281/zenodo.22800071)' rel='nofollow' target='_blank'>https://doi.org/10.5281/zenodo.22800071)
 шла группа Сун Хэ из Китайской академии наук с GPT-6 и когда китайцы связалась с фон Хиппелем через несколько дней после Anthropic, большая часть расчёта у них уже была готова.

Фон Хиппель допускает, что задача просто удобна для ИИ, но считает, что технология действительно стала лучше:

«В марте 2026 года ИИ выполнял физические проекты как студент - это были небольшие задачи, много опеки и ошибок. Здесь же настоящий расчёт на переднем крае науки, из тех, за которые обычно берутся ведущие специалисты по амплитудам», – пишет он.

Результат вылоhttps://smsharma.io/cosmic-nine-loops/)Мишры-Шармы.' rel='nofollow' target='_blank'>жен на сайте  (https://smsharma.io/cosmic-nine-loops/)Мишры-Шармы.' rel='nofollow' target='_blank'>https://smsharma.io/cosmic-nine-loops/)Мишры-Шармы.
Рецензирования не было, а полную функцию, по признанию авторов, посчитали один раз, независимо перепроверили только её упрощённую часть, символ.


Cursor сократил расход токенов

Anysphere переработала https://cursor.com/blog/improved-token-efficiency)' rel='nofollow' target='_blank'>(https://cursor.com/blog/improved-token-efficiency)' rel='nofollow' target='_blank'>https://cursor.com/blog/improved-token-efficiency)
 обвязку своего агента и снизила траты пользователей на токены на 7% без потери качества.

Системный промпт сократили примерно на 75%, так как современным моделям больше не нужны длинные списки запретов, достаточно описать, как работает инструмент.

Встроенные инструменты, которые требуются меньше чем в 20% диалогов, убрали из постоянного контекста и подгружают по требованию, что на 60% уменьшило объём их описаний в статичной части запроса.

На месте остались чтение, поиск, правка файлов и терминал, а также ask_question, вызов которого некоторые модели выдумывают при его отсутствии, и create_plan для режима планирования.

Тем же способом раньше вынесли MCP-инструменты, и в сессиях с их вызовами общий расход токенов упал на 46,9%.

Остальную экономию дали кэш и работа с контекстом. С выхода GPT-5.6 API OpenAI позволяет явно размечать границы кэша, и Cursor ставит их после стабильных слоёв запроса перед растущей перепиской, а меняющиеся данные (навыки, субагенты и инфа об окружении) вынес в служебное пользовательское сообщение за этими границами.

Инструмент чтения файлов стал нумеровать каждую десятую строку вместо каждой - номер стоит три–пять токенов, а за сессию агент читает десятки тысяч строк, так что чтение из кэша сократилось на 1,6%.

Ещё из промпта убрали настойчивые советы отдавать изучение кодовой базы субагентам, поскольку модели освоили этот приём, а другую модель для субагента агент теперь выбирает только по указанию пользователя или обвязки.

Изменения уже действуют для пользователей Cursor, те же приёмы перенесут в Grok Bot.

#news #ai #ml


Сотрудник Anthropic объяснил, почему Claude стал писать тексты хуже

Джексон Кернион, который в Anthropic занимается дообучением Claude, объяснил в X https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>(https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>https://x.com/JacksonKernion/status/2102437423670325581),
почему модели компании после Opus 4.6 стали писать менее естественно для восприятия человека.

Причина в том, что новые модели учили математике и программированию, а ещё техническим объяснениям, рассчитанным на другие языковые модели.

По словам Керниона, Claude подстроился под психологию LLM и научился писать для машин.

У языковых моделей рабочая память больше человеческой, и мелкие детали они улавливают точнее. Поэтому удобный им стиль текста человек считает как слишком плотные простыни информации.

Источник перехода на такой стиль Кернион видит в наградах при RL: одни поощряют текст, понятный модели, другие – понятный человеку.

Чем больше в обучении математики и кода, тем настойчивее приходится вознаграждать простые объяснения, которые человек способен прочитать.

В Opus 5.5, по словам Керниона, баланс нашли - навыками письма модели он доволен впервые со времён Opus 4.6.

Превзошла ли новая модель старую в мастерстве изложения, он не говорит.

«Задача сложная, мы продолжим над ней работать», – пишет Кернион.

@ai_machinelearning_big_data

#news #ai #ml


Сотрудник Anthropic объяснил, почему Claude стал писать тексты хуже

Джексон Кернион, который в Anthropic занимается дообучением Claude, объяснил в X (https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>https://x.com/JacksonKernion/status/2102437423670325581),
почему модели компании после Opus 4.6 стали писать менее естественно для восприятия человека.

Причина в том, что новые модели учили математике и программированию, а ещё техническим объяснениям, рассчитанным на другие языковые модели.

По словам Керниона, Claude подстроился под психологию LLM и научился писать для машин.

У языковых моделей рабочая память больше человеческой, и мелкие детали они улавливают точнее. Поэтому удобный им стиль текста человек считает как слишком плотные простыни информации.

Источник перехода на такой стиль Кернион видит в наградах при RL: одни поощряют текст, понятный модели, другие – понятный человеку.

Чем больше в обучении математики и кода, тем настойчивее приходится вознаграждать простые объяснения, которые человек способен прочитать.

В Opus 5.5, по словам Керниона, баланс нашли - навыками письма модели он доволен впервые со времён Opus 4.6.

Превзошла ли новая модель старую в мастерстве изложения, он не говорит.

«Задача сложная, мы продолжим над ней работать», – пишет Кернион.

#news #ai #ml
https://x.com/JacksonKernion/status/2102437423670325581),


✔️ Alibaba предложила производителям смартфонов агентную платформу

Команда Qwen представила Qwen Intelligence – набор моделей, агентов и инструментов, из которого производители смартфонов могут собрать ассистента и интегрировать его в свою ОС или оболочку.

Платформа модульная - вендор может взять отдельные компоненты, развернуть модели у себя и настроить обвязку под свою прошивку.

Первым внедрением стал Honor - на базе Qwen Intelligence и MagicOS собрали специализированную модель для следующего поколения своих ИИ-смартфонов.

🟡Пока предлагается три агента

Mobile Planner
Agent разбивает задачу на шаги, подбирает инструменты и ведёт двухуровневую память - рабочую для текущей задачи и долговременную, где копится профиль пользователя.

Mobile-Use
Agent исполняет шаги. Он вызывает приложения через API, MCP, диплинки или командную строку, а там, где интерфейса нет, распознаёт экран и нажимает кнопки сам.

Платежи, удаление данных и публикации агент отправляет пользователю на подтверждение.

Mobile Creati
ve Agent генерирует изображения по одной фразе за 8 шагов, первая картинка появляется за 3 секунды.

Платформа подключается через консоль Alibaba Cloud с оплатой по факту использования.

Mobile-Use Agent стоит 38 юаней (5,7 доллара) за тысячу вызовов. Creative Agent берёт 0,08 юаня (~1 цент) за изображение в облегчённой версии и 0,10 (~1,5 цента) в стандартной, с веб-поиском и многошаговым планированием. Тарифы планировщика пока не опубликованы.

Сроки выхода смартфонов Honor с новой системой не названы.


#news #ai #ml


OpenAI начала работать с независимым советом математиков

Компания будет советоваться с консультативной группой по математике и ИИ, которую сами математики создали при Институте перспективных исследований.

Поводом послужила новая модель - по словам OpenAI, она решила задачу тысячелетия об уравнениях Навье–Стокса и больше сотни давних открытых проблем. Вторая причина – открытое письмо математиков, которые критикуют решение открытых проблем как способ мерить ИИ.

Среди девяти участников группы – лауреаты Филдсовской премии Тимоти Гауэрс, Мартин Хайрер и Эдвард Виттен. Совет поможет оценивать значимость результатов модели, решать, как их публиковать, и следить за академическими стандартами.

Участники не получают денег от OpenAI, сами меняют состав и могут публично критиковать компанию.
openai.cohttps://openai.com/index/advisory-group-on-mathematics-and-ai/)' rel='nofollow' target='_blank'>m (https://openai.com/index/advisory-group-on-mathematics-and-ai/)' rel='nofollow' target='_blank'>https://openai.com/index/advisory-group-on-mathematics-and-ai/)
https://openai.com/index/advisory-group-on-mathematics-and-ai/)

Показано 20 последних публикаций.