GLiFormer: энкодер на 575 млн параметров извлекает вложенный JSON без единого сгенерированного токена
Knowledgator Engineering представила GLiFormer — схема-ориентированный энкодер, который объединяет в одной модели распознавание именованных сущностей, классификацию текстов, извлечение отношений, структурирование вложенного JSON и эмбеддинги. На инференсе достаточно передать метки и схему — модель сама решает, как их сопоставить с исходным текстом.
Архитектура развивает идеи GLiNER: вместо генерации токенов модель кодирует источник один раз, а затем оценивает совместимость запрошенных концептов с текстом через «якоря» — групповые векторы для классификации, пары сущностей для отношений или слоты записей. Для NER голова оценивает start/end/inside-сигналы для каждой пары токен-метка, а независимые сигмоиды позволяют вложенным упоминаниям сосуществовать.
Структурирование проходит в четыре этапа: извлечение значений как спанов из текста, назначение спанов слотам записей (обучение с венгерским матчингом), предсказание связей родитель-ребёнок в рамках разрешённой схемы и сборка вложенного JSON детерминированным декодером. Поскольку значения всегда берутся из исходного текста, модель не может выдумать отсутствующие данные — но может ошибиться в выборе спанов или иерархии.
Доступны два чекпойнта: GLiFormer Base v1 (264,2 млн параметров) и GLiFormer Large v1 (575,6 млн). Оба распространяются под Apache 2.0, ставятся через pip install gliformer и работают на CPU или GPU — можно разворачивать уже сегодня.