Wireva

Інженер Anthropic пояснив, чому Claude став гірше писати, попри зростання інтелекту

Співробітник Anthropic Джексон Керніон розповів, що нові моделі Claude пишуть дивно, бо їх оптимізували під математику, код і технічні пояснення для інших ШІ. Opus 5.5 намагається це виправити, але Opus 4.6 залишається найкращою моделлю для чистого письма.

Нові версії Claude можуть розв'язувати складніші задачі з математики та програмування, але їхній стиль письма для людей погіршився. Про це розповів інженер Anthropic Джексон Керніон. За його словами, причина — в оптимізації моделей під технічні завдання та пояснення, орієнтовані на інші ШІ-системи, а не на живих читачів.

Керніон пояснює: коли модель тренують на код, математику та технічні відповіді, вона починає писати надто щільно, насичено й нелюдяно. Людям такий текст здається «перевантаженим інформацією» — наче модель вивалює на читача купу фактів без пауз і пояснень. Це прямий наслідок того, що моделі дедалі частіше оцінюють за тим, як добре вони справляються з задачами для інших моделей, а не за якістю комунікації з людиною.

За словами інженера, Anthropic намагається виправити це в Opus 5.5. Новіша версія має повернути природніший стиль письма. Однак навіть після цих зусиль Opus 4.6 залишається неперевершеним саме як модель для чистого письма. Тобто старіша версія досі виграє там, де потрібен живий, читабельний текст, а не технічна викладка.

Ця ситуація показує ширшу проблему для всіх, хто користується великими мовними моделями в роботі. Продуктові команди, маркетологи й редактори часто обирають модель за бенчмарками — швидкість, точність, код, математика. Але якщо модель пише сухо й перевантажено, її доводиться переписувати вручну або додатково налаштовувати промпти. Для українських команд, які використовують Claude для контенту, листів, брифів чи документації, це означає, що «розумніша» модель не завжди дає кращий текст.

Anthropic — одна з небагатьох компаній, яка публічно визнає такі компроміси. Керніон не наводить конкретних метрик чи дат, але сам факт визнання показує: гонитва за продуктивністю на технічних задачах може коштувати якості комунікації. Для користувачів це практичний сигнал — тестувати моделі під свої задачі, а не покладатися лише на загальні рейтинги.

Українським командам варто звернути увагу на цей кейс. Якщо ви використовуєте Claude для генерації текстів, варто порівнювати версії не за тим, наскільки складною є задача, а за тим, наскільки природно звучить результат. Іноді старіша модель може дати кращий текст, ніж новіша, — і це не помилка, а наслідок того, під що саме її оптимізували.