Мал, да удал
Anthropic выкатили Claude Haiku 5.5. Цену уронили в десять раз: было $1 за 1M входных токенов и $5 за выходные, стало $0,10 и $0,50. До цента как у GPT-6 Luna от OpenAI.
Модель получилась неглупая — Artificial Analysis намерили 43 балла на своем Intelligence Index. Это первое место среди младших: у GLM-5.3 Flash 42, у Gemini 3.8 Flash 41, у Luna 38. До Kimi K3 один балл. Прошлая Haiku набирала 17.
Luna она обходит на каждом уровне "усилий". На medium у Haiku 34 балла, у Luna на high 33. На Terminal-Bench 4.0 независимый замер дал 33% против 13%. На AA-Briefcase, закрытом тесте на офисную работу, 1578 Elo. Это в пределах погрешности от GPT-6 Astra и Fable 5.1. Модели, бтв, совсем другой весовой категории.
Отдельно про галлюцинации. Фактов малышка-Haiku знает меньше конкурентов: 36% точности против 44% у Luna. Зато выдумывает в 40% случаев, а Luna в 77%. Не знает и честно признается. Редкое по нынешним временам качество даже у людей.
Бонусом контекст в 1M токенов вместо 200K.
Как и в классическом анекдоте, есть нюанс. Скидка 90% работает до 100K токенов в запросе. Дальше ценник вырастает впятеро. У Luna надбавка включается с 272K. Плюс новый токенизатор: тот же текст весит на 30% больше токенов. В самой Anthropic говорят про среднюю экономию 75%.
И аппетит. На max модель тратит 162K выходных токенов на задачу, Luna хватает 50K. Последние два балла индекса стоят в 1,8 раза больше токенов. Но это именно max. Те же 38 баллов Haiku берет на high за 55K, Luna на max за 50K. Почти паритет.
Из менее ярких, но более сутевых цифр. По умолчанию стоит medium: 34 балла и 33K токенов на задачу. Крутить ручку до упора никто не заставляет.
@anti_agi
Anthropic выкатили Claude Haiku 5.5. Цену уронили в десять раз: было $1 за 1M входных токенов и $5 за выходные, стало $0,10 и $0,50. До цента как у GPT-6 Luna от OpenAI.
Модель получилась неглупая — Artificial Analysis намерили 43 балла на своем Intelligence Index. Это первое место среди младших: у GLM-5.3 Flash 42, у Gemini 3.8 Flash 41, у Luna 38. До Kimi K3 один балл. Прошлая Haiku набирала 17.
Luna она обходит на каждом уровне "усилий". На medium у Haiku 34 балла, у Luna на high 33. На Terminal-Bench 4.0 независимый замер дал 33% против 13%. На AA-Briefcase, закрытом тесте на офисную работу, 1578 Elo. Это в пределах погрешности от GPT-6 Astra и Fable 5.1. Модели, бтв, совсем другой весовой категории.
Отдельно про галлюцинации. Фактов малышка-Haiku знает меньше конкурентов: 36% точности против 44% у Luna. Зато выдумывает в 40% случаев, а Luna в 77%. Не знает и честно признается. Редкое по нынешним временам качество даже у людей.
Бонусом контекст в 1M токенов вместо 200K.
Как и в классическом анекдоте, есть нюанс. Скидка 90% работает до 100K токенов в запросе. Дальше ценник вырастает впятеро. У Luna надбавка включается с 272K. Плюс новый токенизатор: тот же текст весит на 30% больше токенов. В самой Anthropic говорят про среднюю экономию 75%.
И аппетит. На max модель тратит 162K выходных токенов на задачу, Luna хватает 50K. Последние два балла индекса стоят в 1,8 раза больше токенов. Но это именно max. Те же 38 баллов Haiku берет на high за 55K, Luna на max за 50K. Почти паритет.
Из менее ярких, но более сутевых цифр. По умолчанию стоит medium: 34 балла и 33K токенов на задачу. Крутить ручку до упора никто не заставляет.
@anti_agi