2026 год в LLM: от «часто ошибаются» до «можно доверять каждый день»
На WeAreDevelopers World Congress в Сан-Хосе Саймон Уиллисон рассказал, как развивались языковые модели в 2026 году. Отсчёт он начал с ноября 2025-го, когда вышли Claude Opus 4.5 и GPT-5.1. Сами по себе модели были инкрементальными улучшениями, но в связке с кодовыми агентами (Claude Code, Codex) они пересекли невидимую черту: перестали «часто ошибаться» и стали достаточно надёжными для ежедневной работы.
Уиллисон напомнил про свой «дурацкий» бенчмарк — попросить модель нарисовать SVG с пеликаном на велосипеде. В ноябре даже фронтир-модели с этим справлялись плохо: у Claude рама велосипеда выходила кривой, у GPT-5.1 — не лучше. Но к декабрю разработчики начали экспериментировать с новыми связками моделей и агентов, и к январю стало ясно: возможности выросли радикально.
В 2026-м Уиллисон решил отказаться от привычной новогодней резолюции «сосредоточиться» и вместо этого взял курс на амбициозность: «Единственный способ найти пределы технологии — толкать её, пока она не сломается». Он также вспомнил свои прогнозы на год: предсказал, что «станет неоспоримым, что LLM пишут хороший код» (это уже сбылось), что решат проблему песочниц (ей посвящено около 40 из 277 сессий конференции) и что случится «катастрофа уровня Challenger» в безопасности агентов — пока обошлось, хотя шума вокруг агентной безопасности много.
Отдельно Уиллисон пошутил про новозеландских какапо — нелетающих ночных попугаев, которых осталось всего 236 особей, и предсказал им отличный сезон размножения. Полная видеозапись доклада и слайды доступны на YouTube.