# mini-SWE-agent

Outil de banc d'essai. Fiche relevée le 3 octobre 2026 sur les pages officielles. Page : https://quelleia.com/outils/mini-swe-agent/

## En bref

mini-SWE-agent est un agent de code minimal, conçu par l'équipe de Princeton et Stanford qui a créé SWE-bench et SWE-agent. Son seul outil est le terminal (un shell bash) et il garde un historique linéaire. Cette simplicité en fait un agent de référence pour comparer des modèles sur SWE-bench (classement « bash only »). On l'utilise en ligne de commande (`mini`) ou en lot sur un banc d'essai, et c'est aussi une bibliothèque Python pour programmer.

- Éditeur : Équipe SWE-agent (Princeton et Stanford)
- Prix : gratuit, à l'usage
- Licence : open source (MIT)
- Systèmes : non précisé
- Formes : ligne de commande, bibliothèque pour développeurs (SDK)
- Site officiel : https://mini-swe-agent.com

## Installer

### Tous systèmes (pip)

```
pip install mini-swe-agent
```

### Tous systèmes (uv, environnement isolé)

```
uvx mini-swe-agent
```
```
uv tool install mini-swe-agent
```

### Tous systèmes (pipx, environnement isolé)

```
pipx run mini-swe-agent
```
```
pipx install mini-swe-agent
```

### Tous systèmes (depuis les sources)

```
git clone https://github.com/SWE-agent/mini-swe-agent.git
```
```
cd mini-swe-agent
```
```
pip install -e .
```

### Démarrer

Lancer `mini` : au premier lancement, un assistant demande le modèle par défaut et la clé d'API. On le relance plus tard avec `mini-extra config setup`. L'agent démarre en mode « confirm » : chaque commande proposée attend une validation.
```
mini
```
```
mini-extra config setup
```

### Choisir le modèle

On choisit le modèle avec `-m` ou `--model`, toujours précédé du fournisseur (par exemple `anthropic/claude-…`). Le modèle par défaut se règle avec `mini-extra config set MSWEA_MODEL_NAME <modèle>` ou avec la variable d'environnement `MSWEA_MODEL_NAME`.
```
mini -m <fournisseur/modèle>
```
```
mini-extra config set MSWEA_MODEL_NAME <model-name>
```

Source : https://mini-swe-agent.com/latest/quickstart/ (lue le 3 octobre 2026).

## Ce qu'il sait faire

- **Agent bash seul** : L'agent n'a aucun outil en dehors du terminal et se passe de la fonction d'appel d'outils des modèles : il tourne donc avec n'importe quel modèle. (https://github.com/SWE-agent/mini-swe-agent)
- **Trois modes de travail** : Mode « confirm » (chaque action est validée), « yolo » (exécution directe) et « human » (l'utilisateur tape lui-même les commandes). On passe de l'un à l'autre avec `/c`, `/y` et `/u`. (https://mini-swe-agent.com/latest/usage/mini/)
- **Évaluation en lot sur SWE-bench** : `mini-extra swebench` lance l'agent en parallèle sur toutes les tâches d'un sous-ensemble de SWE-bench. Pour le débogage, `swebench-single` traite une seule tâche. (https://mini-swe-agent.com/latest/usage/swebench/)
- **ProgramBench** : `mini-extra programbench` fait tourner l'agent sur les tâches de ProgramBench, avec une sortie lisible directement par `programbench eval`. (https://mini-swe-agent.com/latest/usage/programbench/)
- **Bacs à sable** : L'agent s'exécute en local, dans Docker ou Podman, Singularity ou Apptainer, bubblewrap ou contree. (https://github.com/SWE-agent/mini-swe-agent)
- **Lecteur de trajectoires** : `mini-extra inspector` ouvre les fichiers `.traj.json` pour relire pas à pas l'historique d'une exécution. (https://mini-swe-agent.com/latest/usage/inspector/)
- **Bibliothèque Python** : Les classes d'agent, de modèle et d'environnement s'importent dans un script Python : on construit ainsi sa propre boucle d'agent. (https://mini-swe-agent.com/latest/usage/python_bindings/)

Les façons de l'utiliser :

- Ligne de commande : commande `mini` (interactive) et `mini-extra` (bancs, configuration, lecteur de trajectoires) (https://mini-swe-agent.com/latest/usage/mini/)
- Bibliothèque pour développeurs (SDK) : bibliothèque Python `minisweagent` (https://mini-swe-agent.com/latest/usage/python_bindings/)

## Sur téléphone

Au 3 octobre 2026, l'éditeur ne documente ni application mobile ni pilotage depuis un téléphone.

## Prix et licence

Gratuit et open source (licence MIT). Les appels aux modèles sont facturés par le fournisseur choisi, avec la clé d'API de l'utilisateur. (relevé le 3 octobre 2026, https://github.com/SWE-agent/mini-swe-agent)

Licence : Open source, licence MIT. (https://github.com/SWE-agent/mini-swe-agent/blob/main/LICENSE.md)

## Modèles

Tous les modèles accessibles par LiteLLM (une bibliothèque qui unifie l'accès aux fournisseurs), plus OpenRouter et Portkey, avec la clé de l'utilisateur : Anthropic, OpenAI, Gemini, Mistral, DeepSeek, xAI, Groq… Les modèles locaux passent aussi par LiteLLM ; la documentation donne des exemples pour Ollama et vLLM.

- Clé d'API personnelle : oui
- Modèles locaux : oui

Avec un modèle local : Servir un modèle local avec Ollama, sur une API compatible OpenAI et Anthropic que la plupart des agents de code savent appeler. Ollama & les modèles locaux (https://minilabai.com/guides/ollama-modeles-locaux/), guide du même auteur que QUELLE IA.

## Résultats mesurés

Comparaison avec les autres outils : https://quelleia.com/outils/harnais/

- DeepSWE · GPT-6 Astra : 74,1 %
- DeepSWE · Gemini 3.8 Flash : 73,8 %
- DeepSWE · Claude Opus 5 : 73,6 %
- DeepSWE · GPT-5.6 Sol : 72,7 %
- DeepSWE · Claude Fable 5 : 69,9 %
- DeepSWE · GPT-5.6 Terra : 69,6 %
- DeepSWE · GLM-5.3 : 69 %
- DeepSWE · Kimi K3 : 68,5 %
- DeepSWE · Grok 4.6 : 67,5 %
- DeepSWE · GPT-5.6 Luna : 67,2 %
- DeepSWE · GPT-5.5 : 67 %
- DeepSWE · Gemini 3.7 Flash : 65,5 %
- DeepSWE · GLM-5.3-Flash : 63,4 %
- DeepSWE · Claude Opus 4.8 : 59 %
- DeepSWE · Qwen 3.8 Max : 57,5 %
- DeepSWE · Muse Spark 1.2 : 54,9 %
- DeepSWE · Claude Sonnet 5 : 53,8 %
- DeepSWE · Grok 4.5 : 53,8 %
- DeepSWE · Muse Spark 1.1 : 53,3 %
- DeepSWE · GPT-5.4 : 51,8 %
- DeepSWE · Gemini 3.6 Flash : 46,7 %
- DeepSWE · GLM-5.2 : 43,8 %
- DeepSWE · Gemini 3.5 Flash : 37,4 %
- DeepSWE · Kimi K2.7 Code : 30,5 %
- DeepSWE · Claude Sonnet 4.6 : 29,9 %
- DeepSWE · Gemini 3.1 Pro : 11,7 %
- FrontierCode · Kimi K3 : 44,2 %
- FrontierCode · Kimi K2.7 Code : 30,1 %
- FrontierCode · GLM-5.2 : 24,5 %
- FrontierCode · DeepSeek-V4-Pro : 17,6 %
- FrontierCode · MiniMax-M3 : 14,7 %
- FrontierCode · Inkling : 14 %
- FrontierCode · Qwen3.7-Plus : 10,2 %
- Terminal-Bench 2.0 · Claude Sonnet 4.5 : 42,5 % (6e sur 7 outils)
- Terminal-Bench 2.0 · GPT-5-Codex : 41,3 % (3e sur 3 outils)
- Terminal-Bench 2.0 · Claude Opus 4.1 : 35,1 % (3e sur 4 outils)
- Terminal-Bench 2.0 · GPT-5 : 33,9 % (4e sur 4 outils)
- Terminal-Bench 2.0 · Claude Haiku 4.5 : 29,8 % (2e sur 5 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025) : 26,1 % (2e sur 4 outils)
- Terminal-Bench 2.0 · grok-code-fast-1 : 25,8 % (1er sur 2 outils)
- Terminal-Bench 2.0 · Grok 4 : 25,4 % (2e sur 3 outils)
- Terminal-Bench 2.0 · GPT-5 mini : 22,2 % (5e sur 5 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025) : 17,1 % (1er sur 4 outils)
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025) : 17,1 % (1er sur 4 outils)
- Terminal-Bench 2.0 · gpt-oss-120b : 14,2 % (2e sur 2 outils)
- Terminal-Bench 2.0 · GPT-5 nano : 7 % (5e sur 5 outils)
- Terminal-Bench 2.0 · gpt-oss-20b : 3,4 % (1er sur 2 outils)

## Sources

- https://github.com/SWE-agent/mini-swe-agent
- https://mini-swe-agent.com/latest/
- https://mini-swe-agent.com/latest/quickstart/
- https://pypi.org/project/mini-swe-agent/
- https://mini-swe-agent.com/latest/models/quickstart/
- https://mini-swe-agent.com/latest/usage/mini/
- https://mini-swe-agent.com/latest/usage/swebench/
- https://mini-swe-agent.com/latest/usage/programbench/
- https://mini-swe-agent.com/latest/usage/inspector/
- https://mini-swe-agent.com/latest/usage/python_bindings/
- https://github.com/SWE-agent/mini-swe-agent/blob/main/LICENSE.md
- https://mini-swe-agent.com/latest/models/local_models/

Non vérifié :

- La documentation ne liste pas les systèmes pris en charge. PyPI indique seulement « OS Independent » et Python 3.10 ou plus ; les conteneurs de SWE-bench et de ProgramBench supposent un Linux x86.
- Aucune page ne donne le pays de l'éditeur.
- La documentation le présente à la fois comme un agent en ligne de commande pour le quotidien et comme un agent de référence pour les bancs d'essai. La fiche le range parmi les outils de banc d'essai.
