Google Cloud выпустил Always-On Memory Agent: память без векторных баз и эмбеддингов
Google Cloud опубликовал в репозитории generative-ai референсную реализацию Always-On Memory Agent. Агент работает непрерывно на Google ADK и Gemini 3.1 Flash-Lite, хранит память в SQLite без векторных баз и эмбеддингов. Три суб-агента обрабатывают входящий контент, консолидируют связи каждые 30 минут и отвечают на запросы с цитированием источников.
Google Cloud добавил в свой репозиторий generative-ai новый образец — Always-On Memory Agent. Он решает одну конкретную проблему: большинство агентов забывают контекст сразу после ответа.
Что это такое
Always-On Memory Agent — фоновый процесс, который не останавливается. Построен на Google ADK (Agent Development Kit) и Gemini 3.1 Flash-Lite. Хранит всё в SQLite. Никаких векторных баз, никаких эмбеддингов — LLM сам читает, думает и записывает структурированную память.
Выбор модели осознанный: Gemini 3.1 Flash-Lite заточен под низкую задержку и низкую стоимость при непрерывной фоновой работе.
Три суб-агента под одним оркестратором
Оркестратор направляет каждый запрос к одному из трёх специализированных суб-агентов.
IngestAgent принимает входящий контент. Использует мультимодальные возможности Gemini: извлекает краткое содержание, сущности, темы и оценку важности. Всё это уходит в таблицу memories. Поддерживает 27 форматов файлов из пяти категорий (текст, изображения, аудио, видео, PDF) - достаточно бросить файл в папку ./inbox.
ConsolidateAgent запускается по таймеру - по умолчанию каждые 30 минут. Он просматривает ещё не связанные воспоминания, находит связи между ними и записывает в базу синтезированное резюме, ключевой вывод и найденные связи. Новое понимание формируется в простое время, без явного промпта.
QueryAgent отвечает на вопросы. Читает все воспоминания и результаты консолидации, синтезирует ответ и цитирует конкретные ID памяти, которые использовал.
Чем отличается от RAG и других подходов
RAG обрабатывает память только в момент запроса. Always-On Memory Agent работает с ней постоянно: принимает, связывает и накапливает контекст независимо от того, поступают ли запросы прямо сейчас.
Конкретные сценарии из описания проекта:
- Исследовательский ассистент за неделю поглощает PDF, аудиозаписи совещаний и скриншоты, а потом самостоятельно связывает цели по стоимости с проблемами надёжности.
- Личная база знаний непрерывно поглощает заметки и статьи - консолидация сама всплывает темами, которые ты явно не формулировал.
- Агент поддержки хранит прошлые тикеты как структурированные воспоминания и отвечает на новые вопросы со ссылками на старые случаи.
Как запустить
Установка минимальная: зависимости, ключ API, старт процесса. После запуска агент следит за ./inbox, консолидирует каждые 30 минут и поднимает HTTP API на порту 8888.
API отдаёт эндпоинты /status, /memories, /consolidate, /delete и /clear. Дополнительно доступен дашборд на Streamlit с контролями для инgest, запросов, просмотра и удаления. Через CLI-флаги можно менять папку наблюдения, порт и интервал консолидации.
Что это значит
Если ты строишь агента, которому нужен долгосрочный контекст, этот референс даёт рабочую архитектуру без сложной инфраструктуры. Никакого Pinecone, никакого Weaviate - только SQLite и модель, которая умеет думать в фоне.
Код доступен в репозитории google/generative-ai на GitHub. Материал опубликован Michal Sutter на MarkTechPost 18 июля 2026 года.
FAQ
Нужен ли доступ к Google Cloud для запуска? Проект использует Google ADK и Gemini 3.1 Flash-Lite через API. Нужен API-ключ Gemini - облачная инфраструктура Google Cloud необязательна.
SQLite справится с большими объёмами памяти? Проект позиционирует себя как референсную реализацию. Для продакшена с большим объёмом данных архитектуру, вероятно, придётся адаптировать - об этом в источнике не говорится.
Можно ли изменить интервал консолидации? Да, через CLI-флаги при запуске. По умолчанию - 30 минут.