Сотрудник Anthropic объяснил, почему Claude стал писать тексты хуже
Джексон Кернион, который в Anthropic занимается дообучением Claude, объяснил в X https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>(https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>https://x.com/JacksonKernion/status/2102437423670325581),
почему модели компании после Opus 4.6 стали писать менее естественно для восприятия человека.
Причина в том, что новые модели учили математике и программированию, а ещё техническим объяснениям, рассчитанным на другие языковые модели.
По словам Керниона, Claude подстроился под психологию LLM и научился писать для машин.
У языковых моделей рабочая память больше человеческой, и мелкие детали они улавливают точнее. Поэтому удобный им стиль текста человек считает как слишком плотные простыни информации.
Источник перехода на такой стиль Кернион видит в наградах при RL: одни поощряют текст, понятный модели, другие – понятный человеку.
Чем больше в обучении математики и кода, тем настойчивее приходится вознаграждать простые объяснения, которые человек способен прочитать.
В Opus 5.5, по словам Керниона, баланс нашли - навыками письма модели он доволен впервые со времён Opus 4.6.
Превзошла ли новая модель старую в мастерстве изложения, он не говорит.
«Задача сложная, мы продолжим над ней работать», – пишет Кернион.
@ai_machinelearning_big_data
#news #ai #ml
Джексон Кернион, который в Anthropic занимается дообучением Claude, объяснил в X https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>(https://x.com/JacksonKernion/status/2102437423670325581),' rel='nofollow' target='_blank'>https://x.com/JacksonKernion/status/2102437423670325581),
почему модели компании после Opus 4.6 стали писать менее естественно для восприятия человека.
Причина в том, что новые модели учили математике и программированию, а ещё техническим объяснениям, рассчитанным на другие языковые модели.
По словам Керниона, Claude подстроился под психологию LLM и научился писать для машин.
У языковых моделей рабочая память больше человеческой, и мелкие детали они улавливают точнее. Поэтому удобный им стиль текста человек считает как слишком плотные простыни информации.
Источник перехода на такой стиль Кернион видит в наградах при RL: одни поощряют текст, понятный модели, другие – понятный человеку.
Чем больше в обучении математики и кода, тем настойчивее приходится вознаграждать простые объяснения, которые человек способен прочитать.
В Opus 5.5, по словам Керниона, баланс нашли - навыками письма модели он доволен впервые со времён Opus 4.6.
Превзошла ли новая модель старую в мастерстве изложения, он не говорит.
«Задача сложная, мы продолжим над ней работать», – пишет Кернион.
@ai_machinelearning_big_data
#news #ai #ml