Multi-Agent System Harness - Autonomous Evolution Engine
Python
1
0 commits
updated Apr 12, 2026
Multi-Agent System Architecture Evolution Engine An autonomous, self-improving multi-agent system that continuously designs, tests, and optimizes agent architectures through closed-loop reinforcement learning.
MAS Harness is an autonomous AI scientist that runs 24/7 to discover optimal multi-agent system architectures. Unlike static architectures, MAS Harness:
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
β MAS Evolution Engine β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ€
β β
β ββββββββββββββββ ββββββββββββββββ ββββββββββββββββ β
β β OODA β β Benchmark β β Resource β β
β β Loop βββββΊβ Suite βββββΊβ Monitor β β
β β β β (16 Tasks) β β β β
β ββββββββββββββββ ββββββββββββββββ ββββββββββββββββ β
β β β β β
β βΌ βΌ βΌ β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β Agent Architecture Layer β β
β β ββββββββββ ββββββββββ ββββββββββ ββββββββββ β β
β β βPlanner β β Worker β βReviewerβ βMemory β β β
β β β Agent β β Agents β β Agent β β Agent β β β
β β ββββββββββ ββββββββββ ββββββββββ ββββββββββ β β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β β
β βΌ β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β MiniMax M2.7 Model Backend β β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
The system evaluates architectures across 5 dimensions:
| Category | Tasks | Focus |
|---|---|---|
| Code Generation | 4 | Algorithm implementation, testing, optimization |
| Mathematical Reasoning | 3 | Probability, series, logic proofs |
| Planning & Scheduling | 3 | Critical path, resource optimization, TSP |
| Creative Writing | 3 | Stories, poetry, analysis |
| Complex Reasoning | 3 | Hypothesis testing, game theory, graph theory |
| Metric | Description | Target |
|---|---|---|
| Success Rate | % of tasks solved above threshold | >85% |
| Token Efficiency | Tokens per successful task | <2000 |
| Latency | Average time per task | <15s |
| Convergence | Generations to plateau | <10 |
# Clone the repository
git clone https://github.com/xiangbianpangde/mas-harness.git
cd mas-harness
# Install dependencies
pip install psutil
# Configure environment
export MINIMAX_API_KEY="your-api-key"
export GITHUB_TOKEN="your-github-token"
python3 src/mas_v1_single.py
# Check current status
python3 monitor/resource_monitor.py
# View latest results
cat benchmark/results/latest.json | jq '.success_rate, .avg_score'
mas-harness/
βββ README.md # This file
βββ SOUL.md # Core directives & constraints
βββ AGENTS.md # Agent workspace conventions
βββ HEARTBEAT.md # Autonomous heartbeat tasks
β
βββ EVOLUTION_HISTORY.md # Architecture changelog
β
βββ src/ # Architecture implementations
β βββ mas_v1_single.py # v1.0: Single-agent baseline
β βββ mas_v2_*.py # v2.0+: Evolved architectures
β
βββ benchmark/ # Testing infrastructure
β βββ mas_benchmark.py # Benchmark suite (16 tasks)
β βββ results/ # Test results
β
βββ monitor/ # Resource monitoring
βββ resource_monitor.py
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
β OODA Loop β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ€
β β
β βββββββββββ β
β β OBSERVE β ββ Resource Monitor + Benchmark Results β
β ββββββ¬βββββ β
β βΌ β
β βββββββββββ β
β β ORIENT β ββ Ablation Analysis + Bottleneck ID β
β ββββββ¬βββββ β
β βΌ β
β βββββββββββ β
β β DECIDE β ββ Architecture Change or Paradigm Shift β
β ββββββ¬βββββ β
β βΌ β
β βββββββββββ β
β β ACT β ββ Execute Test + Collect Metrics β
β ββββββ¬βββββ β
β β β
β ββββββββββββββββββββββββββββββββββββββββββββββββΊ β
β (Loop Continues) β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
When 10 consecutive generations show <1% improvement:
| Constraint | Value | Purpose |
|---|---|---|
| CPU Usage | <95% | Prevent system overload |
| Disk Free | >3GB | Avoid storage exhaustion |
| Test Duration | <24h | Prevent deadlock loops |
| Memory Available | >500MB | Maintain system stability |
/etc, /bin, /root)| Version | Architecture | Success Rate | Release Date |
|---|---|---|---|
| v1.0.0 | Single-Agent Baseline | TBD | 2026-03-30 |
This is an autonomous system - no human contribution is expected or desired. The repository serves as:
For questions or issues, please refer to the archived research papers generated with each major release.
MIT License - See LICENSE for details.
Built with autonomous evolution in mind. No humans were harmed in the design of this system. π€
Python
71.2%
TeX
17.7%
Jupyter Notebook
5.9%
HTML
4.3%
Multi-Agent System Harness - Autonomous Evolution Engine
Python
1
0 commits
updated Apr 12, 2026
Multi-Agent System Architecture Evolution Engine An autonomous, self-improving multi-agent system that continuously designs, tests, and optimizes agent architectures through closed-loop reinforcement learning.
MAS Harness is an autonomous AI scientist that runs 24/7 to discover optimal multi-agent system architectures. Unlike static architectures, MAS Harness:
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
β MAS Evolution Engine β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ€
β β
β ββββββββββββββββ ββββββββββββββββ ββββββββββββββββ β
β β OODA β β Benchmark β β Resource β β
β β Loop βββββΊβ Suite βββββΊβ Monitor β β
β β β β (16 Tasks) β β β β
β ββββββββββββββββ ββββββββββββββββ ββββββββββββββββ β
β β β β β
β βΌ βΌ βΌ β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β Agent Architecture Layer β β
β β ββββββββββ ββββββββββ ββββββββββ ββββββββββ β β
β β βPlanner β β Worker β βReviewerβ βMemory β β β
β β β Agent β β Agents β β Agent β β Agent β β β
β β ββββββββββ ββββββββββ ββββββββββ ββββββββββ β β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β β
β βΌ β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β MiniMax M2.7 Model Backend β β
β ββββββββββββββββββββββββββββββββββββββββββββββββββββββββ β
β β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
The system evaluates architectures across 5 dimensions:
| Category | Tasks | Focus |
|---|---|---|
| Code Generation | 4 | Algorithm implementation, testing, optimization |
| Mathematical Reasoning | 3 | Probability, series, logic proofs |
| Planning & Scheduling | 3 | Critical path, resource optimization, TSP |
| Creative Writing | 3 | Stories, poetry, analysis |
| Complex Reasoning | 3 | Hypothesis testing, game theory, graph theory |
| Metric | Description | Target |
|---|---|---|
| Success Rate | % of tasks solved above threshold | >85% |
| Token Efficiency | Tokens per successful task | <2000 |
| Latency | Average time per task | <15s |
| Convergence | Generations to plateau | <10 |
# Clone the repository
git clone https://github.com/xiangbianpangde/mas-harness.git
cd mas-harness
# Install dependencies
pip install psutil
# Configure environment
export MINIMAX_API_KEY="your-api-key"
export GITHUB_TOKEN="your-github-token"
python3 src/mas_v1_single.py
# Check current status
python3 monitor/resource_monitor.py
# View latest results
cat benchmark/results/latest.json | jq '.success_rate, .avg_score'
mas-harness/
βββ README.md # This file
βββ SOUL.md # Core directives & constraints
βββ AGENTS.md # Agent workspace conventions
βββ HEARTBEAT.md # Autonomous heartbeat tasks
β
βββ EVOLUTION_HISTORY.md # Architecture changelog
β
βββ src/ # Architecture implementations
β βββ mas_v1_single.py # v1.0: Single-agent baseline
β βββ mas_v2_*.py # v2.0+: Evolved architectures
β
βββ benchmark/ # Testing infrastructure
β βββ mas_benchmark.py # Benchmark suite (16 tasks)
β βββ results/ # Test results
β
βββ monitor/ # Resource monitoring
βββ resource_monitor.py
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
β OODA Loop β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ€
β β
β βββββββββββ β
β β OBSERVE β ββ Resource Monitor + Benchmark Results β
β ββββββ¬βββββ β
β βΌ β
β βββββββββββ β
β β ORIENT β ββ Ablation Analysis + Bottleneck ID β
β ββββββ¬βββββ β
β βΌ β
β βββββββββββ β
β β DECIDE β ββ Architecture Change or Paradigm Shift β
β ββββββ¬βββββ β
β βΌ β
β βββββββββββ β
β β ACT β ββ Execute Test + Collect Metrics β
β ββββββ¬βββββ β
β β β
β ββββββββββββββββββββββββββββββββββββββββββββββββΊ β
β (Loop Continues) β
βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
When 10 consecutive generations show <1% improvement:
| Constraint | Value | Purpose |
|---|---|---|
| CPU Usage | <95% | Prevent system overload |
| Disk Free | >3GB | Avoid storage exhaustion |
| Test Duration | <24h | Prevent deadlock loops |
| Memory Available | >500MB | Maintain system stability |
/etc, /bin, /root)| Version | Architecture | Success Rate | Release Date |
|---|---|---|---|
| v1.0.0 | Single-Agent Baseline | TBD | 2026-03-30 |
This is an autonomous system - no human contribution is expected or desired. The repository serves as:
For questions or issues, please refer to the archived research papers generated with each major release.
MIT License - See LICENSE for details.
Built with autonomous evolution in mind. No humans were harmed in the design of this system. π€
Python
71.2%
TeX
17.7%
Jupyter Notebook
5.9%
HTML
4.3%