← К техническим практикам

AIAgent

Руководство по TencentDB Agent Memory (2026): многоуровневая память L0–L3 для AI-агентов

Около 12 мин чтения

MacBook с кодом на столе — рабочее место для интеграции и отладки плагина TencentDB Agent Memory
Память агента обычно внедряется в поток «писать код + запускать сервисы + смотреть логи» — macOS или облачный Mac удобнее как постоянный узел

Обновлено 5 августа 2026. Команды установки и поля конфигурации сверены с официальным репозиторием TencentDB-Agent-Memory, документацией npm-плагина и руководством по подключению Tencent Cloud Memory.

Если вы собирали AI-агента на OpenClaw, Hermes или своём фреймворке, наверняка сталкивались с типичным сценарием: на третьем ходу диалога он забывает ваш Swift style guide; после двадцати tool calls контекст лопается, и агент начинает выдумывать пути к файлам; в новой сессии приходится заново объяснять контекст проекта.

Классический подход — «засунуть всю историю в векторную базу» или «грубо сжать саммари». Tencent в 2026 году открыла под MIT TencentDB Agent Memory с другой логикой: символическая краткосрочная память + четыре слоя долгосрочной (L0–L3), по умолчанию локальный SQLite + sqlite-vec, без облачных зависимостей на старте. Это руководство для iOS-, Flutter- и AI-разработчиков: сначала модель, затем установка плагина, затем решение — оставить данные локально или вынести Gateway на облачный Mac 7×24.

Введение: почему агенты «забывают»

Провалы длинных агентов редко связаны с «глупостью» модели. Чаще ломается управление контекстом. В задачах вроде Wide Search или SWE-bench JSON от инструментов, тела веб-страниц и логи сборки легко набирают сотни тысяч токенов. Если держать всё в окне — растут счёт и задержка; если удалять наугад — агент на следующем шаге повторяет поиск или правит не тот файл.

TencentDB Agent Memory решает именно этот конфликт: агент помнит нужное, а цепочка доказательств остаётся в нижних слоях с возможностью детального просмотра. В публичных бенчмарках плагина OpenClaw для краткосрочной памяти заявлена экономия до ~61% токенов, точность PersonaMem для долгосрочной памяти — с 48% до 76%. Цифры зависят от модели и задачи, но направление ясно: слои + выгрузка эффективнее плоского векторного индекса.

Для читателей Kvmkit эта система чаще всего встречается в двух сценариях: (1) на Mac подключаете плагин OpenClaw Memory к Cursor или Claude Code для проектного контекста; (2) на Windows пишете Flutter, а на облачном Mac mini крутите Gateway + локальный MLX/Ollama — память и Xcode-сборки на одном стабильном узле.

Без слоя памяти каждый новый чат похож на коллегу без онбординга: первый ответ бодрый, к третьему раунду контекст уже «плывёт». Память превращает агента в партнёра, который накапливает знания о проекте неделями.

Ключевые концепции: слои памяти и символическое сжатие

Проект сознательно отказывается от схемы «нарезать каждый ход на embeddings и надеяться на retrieval». Долгосрочно — семантическая пирамида; краткосрочно — холст задач Mermaid. Оба механизма поддерживают постепенное раскрытие: в контекст модели попадает только верхний уровень структуры, к сырым данным спускаются по индексу при необходимости.

Четыре слоя долгосрочной памяти (L0 → L3)

  • L0 Conversation — сырой диалог и трассировки инструментов, неизменяемая «база доказательств»;
  • L1 Atom — структурированные факты из диалога (даты, предпочтения, стек);
  • L2 Scenario — группировка атомов в сценарные блоки (например, «процесс подписи iOS CI»);
  • L3 Persona — кросс-сценарный профиль пользователя в читаемом persona.md, подгружаемый перед следующей сессией.

Восстановление начинается с Persona и Scenario, затем Atom или текст L0 — как вспомнить, что «этот коллега предпочитает SwiftUI», прежде чем листать переписку.

Краткосрочная память: выгрузка Mermaid

Логи инструментов уходят в refs/*.md; в контексте остаётся лёгкий граф Mermaid с node_id. Агент рассуждает по символам; если узел подозрителен — grep по node_id возвращает полный лог. 100% прослеживаемость без возврата мегабайт stdout в окно.

Архитектура TencentDB Agent Memory: четыре слоя долгосрочной памяти и символическое краткосрочное сжатие
Пирамида L0–L3 + краткосрочный холст Mermaid: структура верхнего уровня в контексте, спуск к доказательствам через node_id

Если вы уже собираете цепочку MCP-инструментов, поставьте плагин памяти рядом с руководством по развёртыванию GitHub MCP Server на Windows, Linux и macOS: инструменты отвечают на «что я могу сделать?», память — на «что мы уже делали и кто этот пользователь?».

Практика: плагин OpenClaw и развёртывание Gateway

Самый быстрый путь — плагин OpenClaw (Node.js ≥ 22.16). Команды ниже — в терминале macOS или Linux; на Windows разумнее WSL2 или Gateway на облачном Mac.

Вариант A: OpenClaw без лишней настройки (для старта)

# Установка плагина
openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
openclaw gateway restart

В ~/.openclaw/openclaw.json включите:

{
  "memory-tencentdb": {
    "enabled": true
  }
}

Бэкенд по умолчанию — локальный SQLite. Плагин сам ведёт запись диалогов, извлечение памяти, группировку сценариев, генерацию persona и recall на следующем ходу. Обновление: openclaw plugins update @tencentdb-agent-memory/memory-tencentdb — широкие semver-диапазоны иногда отключают плагин незаметно.

Включение краткосрочного сжатия (≥ 0.3.4)

Включите offload и зарегистрируйте слот contextEngine:

{
  "memory-tencentdb": {
    "config": {
      "offload": { "enabled": true }
    }
  },
  "plugins": {
    "slots": {
      "contextEngine": "memory-tencentdb"
    }
  }
}

Запустите scripts/openclaw-after-tool-call-messages.patch.sh из репозитория (повторяйте после апгрейда OpenClaw). Без патча результаты tool calls часто не выгружаются — типичная причина «плагин стоит, а токены не падают».

Вариант B: Hermes Docker «всё в одном»

Для Hermes Agent — контейнер с памятью (Gateway на порту 8420):

cd TencentDB-Agent-Memory/docker/opensource
docker build -f Dockerfile.hermes -t hermes-memory .
docker run -d --name hermes-memory -p 8420:8420 \
  -e MODEL_API_KEY="your-api-key" \
  -v hermes_data:/opt/data hermes-memory
curl http://localhost:8420/health

Ответ {"status":"ok"} или degraded — можно продолжать. В образе по умолчанию точка доступа DeepSeek-V3.2; для этой модели часто хватает одного API Key.

Вариант C: свой Agent + Python SDK (облако)

Когда команде нужна управляемая память в Tencent Cloud — создайте инстанс Memory в консоли и установите SDK:

pip install tencentdb-agent-memory-sdk

Пишите сессии и извлекайте атомы через асинхронный клиент (поля — по консоли). Подходит для Python-оркестрации и общей памяти команды; личный пробный запуск облаку не обязан.

Чек-лист приёмки

  • После трёх раундов диалога проверьте persona.md или файлы сценариев;
  • С включённым offload сравните кривую токенов на одной и той же SWE-задаче;
  • Попросите агента сослаться на старый результат инструмента — убедитесь в восстановлении через node_id из refs/;
  • При бесконечном цикле tool calls сначала смотрите руководство по остановке цикла Tool Calls в Kimi K3 — цепочку сообщений, а не сам плагин памяти.

Связь с облачным Mac и Apple Silicon

Memory Gateway — постоянный сервис: слушает порт, читает/пишет SQLite, в фоне гоняет извлечение и recall. Сон ноутбука, перезагрузка Windows и нестабильный домашний интернет для агента выглядят как внезапная «амнезия». Для iOS-команды реалистичнее такая схема:

  • Локально — Cursor или Xcode для ежедневного кода;
  • Облачный Mac mini — Gateway OpenClaw + TencentDB Memory + Ollama/MLX на одной машине;
  • Удалённо — SSH или screen sharing для отладки; том данных на диске в облаке.

Apple Silicon даёт unified memory и нативный Unix: Node 22, Docker Desktop и Homebrew ведут себя предсказуемо; Gateway на M4 Mac mini держится на считанных ваттах — заметно ниже десктопной видеокарты. Если вы уже смотрите локальный инференс малых моделей на GPU, оставьте тяжёлую инференс-нагрузку на Windows, а память и macOS-задачи, которым нужен uptime, перенесите на облачный Mac Kvmkit — закрытие крышки ноутбука не оборвёт сессию агента.

Для смешанных команд Windows/macOS это часто прагматичный split: Windows-ноутбук для встреч и почты, облачный Mac как «бункер агента», который не засыпает. База памяти там растёт непрерывно; persona и сценарии остаются согласованными, даже если никто физически не сидит за Mac.

Сравнение: стоимость, производительность и риски

ПодходМесячные затраты (оценка)Кому подходитГлавный риск
Локальный плагин SQLite0 ₽ (только API LLM)Личные эксперименты OpenClawСон машины рвёт continuity; бэкап вручную
Свой Docker GatewayЭлектричество + APIМалая команда, Hermes в LANОбновления образа и рост диска
Управляемый Tencent Cloud MemoryТариф инстансаОбщая память нескольких агентовCompliance и резидентность данных
Облачный Mac KvmkitПочасово или пакетGateway + Xcode + MLX на одном хостеСеть и управление секретами

Простое правило: прототип на локальном SQLite без инфраструктурных затрат; как только память становится командным активом — миграция на always-on облачный Mac или инстанс Tencent. Две недели «продакшн-агента» на ноутбуке перед переносом — миграция L0 и refs/ обычно недооценивается.

Бэкап и шифрование входят в тот же план: файлы SQLite и каталог refs/ часто содержат промпты, пути репозиториев и ответы API. На облачном Mac закладывайте снапшоты или регулярный экспорт — не только после первой потери данных.

Частые вопросы

Обязательно ли подключать Tencent Cloud?

Нет. Плагин OpenClaw по умолчанию на локальном SQLite, без внешнего Memory API. Инстанс Tencent Cloud + Python SDK — только для управляемого хостинга, масштабирования векторов или облачного хранения по compliance.

Чем это отличается от LangChain или Mem0?

Акцент на L0–L3 и выгрузке Mermaid, а не на «всё в один векторный индекс». Путь recall: Persona → Scenario → Atom → сырой текст — аудируемо и с детализацией.

Нужен ли отдельный Gateway после плагина OpenClaw?

В OpenClaw достаточно gateway restart. Hermes или самописные Python-агенты требуют здорового Gateway на порту 8420 — через Docker или npx tsx, как в документации.

Какие требования к Mac?

npm-плагин: Node.js ≥ 22.16; краткосрочное сжатие: плагин ≥ 0.3.4. Apple Silicon нативно, удобно с MLX или Ollama на том же хосте.

Итог

  • TencentDB Agent Memory сочетает L0–L3 и выгрузку Mermaid против раздувания контекста; для старта хватает локального SQLite.
  • Плагин OpenClaw — самый быстрый вход; Hermes — через Docker; корпоративные стеки — Python SDK в облаке.
  • Когда память и macOS-цепочка должны работать 7×24, облачный Mac mini надёжнее ноутбука в режиме сна.

Память агента не решается «ещё парой векторов». Сначала прогоните слоистую модель, потом решайте — данные остаются в локальном SQLite или переезжают на командный узел. Этот шаг упрощает дальнейшее подключение iOS CI, MCP-инструментов или более тяжёлых моделей.

Узел памяти агента на облачном Mac — надёжнее

Gateway TencentDB Agent Memory требует среды с постоянным uptime, редкими сбоями и полным Unix-стеком. Mac mini на Apple Silicon тихий и экономичный; unified memory M4 тянет параллельно извлечение памяти и локальный инференс. Облачный Mac Kvmkit избавляет от покупки железа и собирает OpenClaw, Memory и Xcode в одном удалённом рабочем пространстве — подключение с Windows-ПК через remote desktop.

Тарифы облачного Mac Kvmkit — постоянный узел для командного агента, который не «забывает», когда кто-то закрывает крышку ноутбука.

Память агента 7×24? Облачный Mac упрощает жизнь

Gateway OpenClaw + TencentDB Memory рядом с Xcode на always-on хосте — подключайтесь с Windows-ПК через remote desktop.