Волна ИИПодписаться
← Назад
Модели и агенты

Photon-1: модель, которая учится по видео без подсказок — смотрит 18 лет и играет в шашки

26.07.2026 · marktechpost.com ↗

Induction Labs выпустила Photon-1 — первую модель из семейства «imagination models», которые обучаются на сыром видео без аннотаций действий. Архитектура — разреженный MoE-трансформер на 106B параметров (5B активных), обученный на 18 годах записей работы за компьютером. Внутренний бенчмарк по компьютерным задачам показывает, что Photon-1 превосходит Gemini 3.1 Flash-Lite при значительно меньших затратах на претрейн и втрое меньшей стоимости инференса.

Ключевая идея: модель предсказывает будущие кадры в сжатом латентном пространстве, не генерируя пиксели. Induction Labs называет это «имплицитной политикой» — модель учится понимать, что делает человек, а не запоминает метки кликов. Для сжатия используется конечная скалярная квантизация (FSQ): каждый кадр превращается в 960 дискретных токенов по 8 измерений с пятью возможными значениями каждое — итого 5⁸ возможных кодов, около 2,2 КБ на кадр. Это более чем в 100 раз эффективнее существующих OCR- и мультимодальных представлений.

Дополнительное сжатие даёт дифференциальный латентный энкодер: он кодирует пары кадров, описывая разницу между ними, а не сами кадры. В демонстрациях Photon-1 симулирует рабочий стол, играет в шашки и моделирует физику бильярда — всё на основе одного претрейна без дообучения под конкретные задачи.

Источник: marktechpost.com
← Все новости AI Wave