Текстовые передачи тормозят ИИ — C2C связывает модели через KV-кэши
Учёные предлагают передавать данные между ИИ-моделями не через текст, а напрямую через их внутренние представления — KV-кэши.
Что произошло
Учёные предлагают передавать данные между ИИ-моделями не через текст, а напрямую через их внутренние представления — KV-кэши. Метод Cache-to-Cache (C2C) разработали исследователи из Университета Цинхуа и других китайских организаций. В экспериментах он повысил точность на 3,1–5,4 процентного пункта и сократил задержку на всех проверенных связках моделей.
Сегодня модели в мультиагентных системах и маршрутизаторах обычно общаются текстом: одна формулирует выводы или инструкции, а другая читает их и заново восстанавливает контекст. При этом часть информации теряется, а смысл может исказиться. Например, модель, редактирующая код, может понимать точное место в структуре HTML, но не суметь передать его другой модели достаточно однозначно.
Детали запуска
Текстовый обмен также замедляет работу. Первая модель генерирует сообщение последовательно, токен за токеном, а второй приходится обрабатывать полученный текст перед ответом. Чем длиннее передача и чем больше переходов между агентами, тем выше вычислительные затраты.
C2C превращает KV-кэш — уже созданное моделью внутреннее представление контекста — в канал связи между моделями. Это может стать отдельным направлением оптимизации для команд, создающих маршрутизаторы моделей и мультиагентные системы. Исследование представили на ICLR 2026; в сентябре авторы планировали выпустить реализацию «управляемого агентом KV-кэша» и систему для развёртывания моделей.