NVIDIA выпустила TensorRT Model Connect: два консольных вызова — и Hugging Face чекпоинт работает на C++ без PyTorch
TensorRT Model Connect (TRTMC) — это open-source проект NVIDIA (Apache 2.0), который берёт готовую модель с Hugging Face или локальный чекпоинт и за две команды собирает версионированный .bundle-артефакт для инференса на C++. Промежуточный экспорт в ONNX не нужен: сборка сразу строит движки TensorRT, а готовый бандл запускается через нативные C++ API — без PyTorch в рантайме. Это значит, что модель работает в C++ сервисе, встроенном устройстве или роботизированном стеке.
Команды простые: trtmc build Qwen/Qwen3-0.6B --precision bf16, затем trtmc run ./qwen3-0.6b.bundle. В C++ бандл загружается одной строкой trtmc::load(...). Приложения вызывают task-API (generate, transcribe, embed и т.д.), избавляясь от ручной интеграции каждой модели. NVIDIA отмечает, что традиционный путь PyTorch → ONNX → TensorRT → своя обвязка страдает от ошибок экспорта, повторяющейся интеграции и разрозненной валидации — TRTMC закрывает эти проблемы.
На данный момент колёса (wheels) собираются только под Linux aarch64 с Python 3.10/3.12, glibc 2.39+ и TensorRT 11.1. Пользователям x86_64 придётся использовать Docker для сборки из исходников. Инструмент лучше всего подходит командам, у которых уже есть свой инфраструктурный слой под инференс: стартапы, работающие с железом NVIDIA, робототехника, встраиваемые системы, крупные и средние предприятия. Для небольших команд, запускающих Python-сервис, выгода меньше. Регулируемым организациям NVIDIA советует дождаться tagged-релиза.
Примечательно, что весь проект — реализация моделей, настройка производительности, тесты, интеграции и документация — был создан с помощью агентов OpenAI Codex под руководством и ревью человека. TRTMC распространяется как набор референсных реализаций для отдельных семейств моделей, а не как универсальный конвертер. Бандл можно инспектировать через trtmc inspect — он показывает тип, семейство, точность и движки, делая артефакт прозрачным и аудитируемым.