VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиGoogle Cloud выпустил Always-On Memory Agent: память без векторных баз и эмбеддингов
НовостьРелизGemini

Google Cloud выпустил Always-On Memory Agent: память без векторных баз и эмбеддингов

VCL
Редакция
Vibe Coding Lab
18 июля 2026обновлено 18.07
3 мин чтения
КОРОТКО

Google Cloud опубликовал в репозитории generative-ai референсную реализацию Always-On Memory Agent. Агент работает непрерывно на Google ADK и Gemini 3.1 Flash-Lite, хранит память в SQLite без векторных баз и эмбеддингов. Три суб-агента обрабатывают входящий контент, консолидируют связи каждые 30 минут и отвечают на запросы с цитированием источников.

Google Cloud добавил в свой репозиторий generative-ai новый образец — Always-On Memory Agent. Он решает одну конкретную проблему: большинство агентов забывают контекст сразу после ответа.

Что это такое

Always-On Memory Agent — фоновый процесс, который не останавливается. Построен на Google ADK (Agent Development Kit) и Gemini 3.1 Flash-Lite. Хранит всё в SQLite. Никаких векторных баз, никаких эмбеддингов — LLM сам читает, думает и записывает структурированную память.

Выбор модели осознанный: Gemini 3.1 Flash-Lite заточен под низкую задержку и низкую стоимость при непрерывной фоновой работе.

Три суб-агента под одним оркестратором

Оркестратор направляет каждый запрос к одному из трёх специализированных суб-агентов.

IngestAgent принимает входящий контент. Использует мультимодальные возможности Gemini: извлекает краткое содержание, сущности, темы и оценку важности. Всё это уходит в таблицу memories. Поддерживает 27 форматов файлов из пяти категорий (текст, изображения, аудио, видео, PDF) - достаточно бросить файл в папку ./inbox.

ConsolidateAgent запускается по таймеру - по умолчанию каждые 30 минут. Он просматривает ещё не связанные воспоминания, находит связи между ними и записывает в базу синтезированное резюме, ключевой вывод и найденные связи. Новое понимание формируется в простое время, без явного промпта.

QueryAgent отвечает на вопросы. Читает все воспоминания и результаты консолидации, синтезирует ответ и цитирует конкретные ID памяти, которые использовал.

Чем отличается от RAG и других подходов

RAG обрабатывает память только в момент запроса. Always-On Memory Agent работает с ней постоянно: принимает, связывает и накапливает контекст независимо от того, поступают ли запросы прямо сейчас.

Конкретные сценарии из описания проекта:

  • Исследовательский ассистент за неделю поглощает PDF, аудиозаписи совещаний и скриншоты, а потом самостоятельно связывает цели по стоимости с проблемами надёжности.
  • Личная база знаний непрерывно поглощает заметки и статьи - консолидация сама всплывает темами, которые ты явно не формулировал.
  • Агент поддержки хранит прошлые тикеты как структурированные воспоминания и отвечает на новые вопросы со ссылками на старые случаи.

Как запустить

Установка минимальная: зависимости, ключ API, старт процесса. После запуска агент следит за ./inbox, консолидирует каждые 30 минут и поднимает HTTP API на порту 8888.

API отдаёт эндпоинты /status, /memories, /consolidate, /delete и /clear. Дополнительно доступен дашборд на Streamlit с контролями для инgest, запросов, просмотра и удаления. Через CLI-флаги можно менять папку наблюдения, порт и интервал консолидации.

Что это значит

Если ты строишь агента, которому нужен долгосрочный контекст, этот референс даёт рабочую архитектуру без сложной инфраструктуры. Никакого Pinecone, никакого Weaviate - только SQLite и модель, которая умеет думать в фоне.

Код доступен в репозитории google/generative-ai на GitHub. Материал опубликован Michal Sutter на MarkTechPost 18 июля 2026 года.

FAQ

Нужен ли доступ к Google Cloud для запуска? Проект использует Google ADK и Gemini 3.1 Flash-Lite через API. Нужен API-ключ Gemini - облачная инфраструктура Google Cloud необязательна.

SQLite справится с большими объёмами памяти? Проект позиционирует себя как референсную реализацию. Для продакшена с большим объёмом данных архитектуру, вероятно, придётся адаптировать - об этом в источнике не говорится.

Можно ли изменить интервал консолидации? Да, через CLI-флаги при запуске. По умолчанию - 30 минут.

Marktechpost · 18 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться