PC-ALM: локальное обучение без backprop — сети из 1000 слоёв почти догнали классику
Backpropagation — глобальный алгоритм: прямой проход, обратный проход, обновление весов — каждый шаг ждёт предыдущий. В мозге нет механизма такой синхронизации, поэтому исследователи ищут локальные альтернативы, например предсказательное кодирование (PC). Sakana AI представила PC-ALM (Augmented Lagrangian Predictive Coding) — вариант PC, где каждый слой обновляется локально, но сигнал ошибки восстанавливается почти как в backprop.
Ключевая проблема классического PC: в глубоких и узких сетях сигнал ошибки затухает, не доходя до первых слоёв. PC-ALM решает это через метод множителей Лагранжа: к каждому слою добавляется множитель λ, который накапливает ошибку предсказания. По сути, каждый слой работает как ПИ-регулятор: ошибка — пропорциональная компонента, множитель — интегральная. Это позволяет сигналу ошибки «просачиваться» сквозь всю сеть.
В линейном случае команда доказала, что PC-ALM сходится к точке KKT, где множители Лагранжа совпадают с adjoint-градиентами backprop. На практике на Fashion-MNIST и MNIST с сетями шириной и глубиной от 8 до 128 PC-ALM сравнялся с backprop по всем конфигурациям, тогда как PC резко деградировал в глубоких узких сетях. Например, на референсной ячейке (32×32, ReLU, Fashion-MNIST) точность: BP — 78.66%, PC — 68.13%, PC-ALM — 77.75%, а косинус градиента с BP вырос с 0.604 до 0.909.
Код опубликован на GitHub под лицензией MIT, реализация на JAX работает на CPU. Это метод обучения, а не модель, и пока он проверен только на небольших картинках. Но если масштабируется на большие архитектуры, это шаг к биологически правдоподобному обучению глубоких сетей без глобальной синхронизации.