marcot3ssar1/InfiniteMemOs

infiniteMem - the memory that does not lie. Deterministic episodic memory for agents. LoCoMo 70.49%.

0

stars

4

commits

Python

primary language

Sep 6, 2026

updated

agent-memory
ai-agents
benchmark
conversational-ai
deterministic
embeddings
episodic-memory
llm-evaluation
llm-memory
locomo
long-term-memory
mcp
memory-systems
nlp
on-prem
privacy
rag
retrieval-augmented-generation
self-hosted
vector-search

README

infiniteMem — 1M episodes / 145M tokens. The memory that doesn't lie.

Deterministic, self-hosted episodic memory for agents (K3 engine): 1M episodes / 145M tokens per deployment — ~1,450 novels, ~1,130× a GPT-4o context window, ~27 years of chat. Details: CAPACITY.md.

LoCoMo QA 70.49% under equal protocol, reproducible evaluation glue. No implementation sources are included by design. Closed source — see NOTICE.

Try it: an MCP server with a free trial is coming — run infiniteMem from Claude Desktop and your agents without sharing data externally. Contact via repository for trial access.

Contents

  • paper/ — scientific report v2 (LoCoMo + LongMemEval, stronger-reader rows, world-model gate, reranker study, limits, references).
  • harness/ — evaluation scripts only (dataset fetch checks, fresh embedding via NVIDIA API, numpy retrieval crosscheck, QA answer+judge via OpenRouter, rerank gate). They drive the closed engine as a black box and reveal nothing about its internals.
  • results/ — certified numbers: leaderboard.json (LoCoMo, SOTA2-ready), leaderboard_lmem.json (LongMemEval-S), readers.json (stronger-reader rows + world-model gate), per-question qa_cache.jsonl (3070 records, no gold texts), retrieval and QA reports, reranker negative-result report.

Reproducing the scores

  1. Fetch snap-research/locomo data/locomo10.json (CC BY-NC 4.0, non-commercial, cite Maharana et al., ACL 2024) and verify SHA256 79FA87E9….
  2. Set env keys (never commit): NVIDIA_API_KEY (embeddings llama-nemotron-embed-vl-1b-v2, 768-D, passage Speaker: text / query raw) and OPENROUTER_API_KEY (answer+judge openai/gpt-4o-mini-2024-07-18, temp 0, verbatim Mem0 prompts).
  3. Run harness in order: exnovo_embed.pyeval_fresh_retrieval.pyexnovo_qa.py --mode k3 + --mode oracle. Expected: retrieval 78.85/74.10, QA k3 70.49 / oracle 84.89 (±0.5pp API variance).

Disclosure (fair comparison)

Black-box engine, brute top-10 single-shot, dedup off, no rerank, 1 run. Answer/judge models and prompts pinned (see paper §3, §6). Dataset CC BY-NC 4.0. Contact via repository for engine access.

Contributors

marcot3ssar1

4 commits

marcot3ssar1/InfiniteMemOs

infiniteMem - the memory that does not lie. Deterministic episodic memory for agents. LoCoMo 70.49%.

0

stars

4

commits

Python

primary language

Sep 6, 2026

updated

agent-memory
ai-agents
benchmark
conversational-ai
deterministic
embeddings
episodic-memory
llm-evaluation
llm-memory
locomo
long-term-memory
mcp
memory-systems
nlp
on-prem
privacy
rag
retrieval-augmented-generation
self-hosted
vector-search

README

infiniteMem — 1M episodes / 145M tokens. The memory that doesn't lie.

Deterministic, self-hosted episodic memory for agents (K3 engine): 1M episodes / 145M tokens per deployment — ~1,450 novels, ~1,130× a GPT-4o context window, ~27 years of chat. Details: CAPACITY.md.

LoCoMo QA 70.49% under equal protocol, reproducible evaluation glue. No implementation sources are included by design. Closed source — see NOTICE.

Try it: an MCP server with a free trial is coming — run infiniteMem from Claude Desktop and your agents without sharing data externally. Contact via repository for trial access.

Contents

  • paper/ — scientific report v2 (LoCoMo + LongMemEval, stronger-reader rows, world-model gate, reranker study, limits, references).
  • harness/ — evaluation scripts only (dataset fetch checks, fresh embedding via NVIDIA API, numpy retrieval crosscheck, QA answer+judge via OpenRouter, rerank gate). They drive the closed engine as a black box and reveal nothing about its internals.
  • results/ — certified numbers: leaderboard.json (LoCoMo, SOTA2-ready), leaderboard_lmem.json (LongMemEval-S), readers.json (stronger-reader rows + world-model gate), per-question qa_cache.jsonl (3070 records, no gold texts), retrieval and QA reports, reranker negative-result report.

Reproducing the scores

  1. Fetch snap-research/locomo data/locomo10.json (CC BY-NC 4.0, non-commercial, cite Maharana et al., ACL 2024) and verify SHA256 79FA87E9….
  2. Set env keys (never commit): NVIDIA_API_KEY (embeddings llama-nemotron-embed-vl-1b-v2, 768-D, passage Speaker: text / query raw) and OPENROUTER_API_KEY (answer+judge openai/gpt-4o-mini-2024-07-18, temp 0, verbatim Mem0 prompts).
  3. Run harness in order: exnovo_embed.pyeval_fresh_retrieval.pyexnovo_qa.py --mode k3 + --mode oracle. Expected: retrieval 78.85/74.10, QA k3 70.49 / oracle 84.89 (±0.5pp API variance).

Disclosure (fair comparison)

Black-box engine, brute top-10 single-shot, dedup off, no rerank, 1 run. Answer/judge models and prompts pinned (see paper §3, §6). Dataset CC BY-NC 4.0. Contact via repository for engine access.

Contributors

marcot3ssar1

4 commits

Languages

Python

100.0%