Aller au contenu
L'actu IAEN 4 QUESTIONSTrouver mon modèle
Outils · outil de banc d'essai

mini-SWE-agent

mini-SWE-agent est un agent de code minimal, conçu par l'équipe de Princeton et Stanford qui a créé SWE-bench et SWE-agent.

En bref

Ce que c'est
mini-SWE-agent est un agent de code minimal, conçu par l'équipe de Princeton et Stanford qui a créé SWE-bench et SWE-agent. Son seul outil est le terminal (un shell bash) et il garde un historique linéaire. Cette simplicité en fait un agent de référence pour comparer des modèles sur SWE-bench (classement « bash only »). On l'utilise en ligne de commande (mini) ou en lot sur un banc d'essai, et c'est aussi une bibliothèque Python pour programmer.
Éditeur
Équipe SWE-agent (Princeton et Stanford)
Prix
gratuità l'usage
Licence
open source (MIT)
Systèmes
non précisé
Formes
ligne de commande, bibliothèque pour développeurs (SDK)

Site officiel de mini-SWE-agentFiche relevée le sur les pages officielles.

Installer

Tous systèmes (pip)

pip install mini-swe-agent

Tous systèmes (uv, environnement isolé)

uvx mini-swe-agent
uv tool install mini-swe-agent

Tous systèmes (pipx, environnement isolé)

pipx run mini-swe-agent
pipx install mini-swe-agent

Tous systèmes (depuis les sources)

git clone https://github.com/SWE-agent/mini-swe-agent.git
cd mini-swe-agent
pip install -e .

Paquets vérifiés sur leur registre : mini-swe-agent (pip).

Démarrer

Lancer mini : au premier lancement, un assistant demande le modèle par défaut et la clé d'API. On le relance plus tard avec mini-extra config setup. L'agent démarre en mode « confirm » : chaque commande proposée attend une validation.

mini
mini-extra config setup

Choisir le modèle

On choisit le modèle avec -m ou --model, toujours précédé du fournisseur (par exemple anthropic/claude-…). Le modèle par défaut se règle avec mini-extra config set MSWEA_MODEL_NAME <modèle> ou avec la variable d'environnement MSWEA_MODEL_NAME.

mini -m <fournisseur/modèle>
mini-extra config set MSWEA_MODEL_NAME <model-name>

D'après la documentation officielle (mini-swe-agent.com), lue le . Les commandes sont recopiées telles quelles.

Ce qu'il sait faire

Agent bash seul
L'agent n'a aucun outil en dehors du terminal et se passe de la fonction d'appel d'outils des modèles : il tourne donc avec n'importe quel modèle. github.com
Trois modes de travail
Mode « confirm » (chaque action est validée), « yolo » (exécution directe) et « human » (l'utilisateur tape lui-même les commandes). On passe de l'un à l'autre avec /c, /y et /u. mini-swe-agent.com
Évaluation en lot sur SWE-bench
mini-extra swebench lance l'agent en parallèle sur toutes les tâches d'un sous-ensemble de SWE-bench. Pour le débogage, swebench-single traite une seule tâche. mini-swe-agent.com
ProgramBench
mini-extra programbench fait tourner l'agent sur les tâches de ProgramBench, avec une sortie lisible directement par programbench eval. mini-swe-agent.com
Bacs à sable
L'agent s'exécute en local, dans Docker ou Podman, Singularity ou Apptainer, bubblewrap ou contree. github.com
Lecteur de trajectoires
mini-extra inspector ouvre les fichiers .traj.json pour relire pas à pas l'historique d'une exécution. mini-swe-agent.com
Bibliothèque Python
Les classes d'agent, de modèle et d'environnement s'importent dans un script Python : on construit ainsi sa propre boucle d'agent. mini-swe-agent.com

Les façons de l'utiliser

Sur téléphone

Au 3 octobre 2026, l'éditeur ne documente ni application mobile ni pilotage depuis un téléphone.

Prix et licence

Gratuit et open source (licence MIT). Les appels aux modèles sont facturés par le fournisseur choisi, avec la clé d'API de l'utilisateur.

Prix relevés le sur github.com, dans la devise de la page.

Licence

Open source, licence MIT. github.com

Modèles

Tous les modèles accessibles par LiteLLM (une bibliothèque qui unifie l'accès aux fournisseurs), plus OpenRouter et Portkey, avec la clé de l'utilisateur : Anthropic, OpenAI, Gemini, Mistral, DeepSeek, xAI, Groq… Les modèles locaux passent aussi par LiteLLM ; la documentation donne des exemples pour Ollama et vLLM. mini-swe-agent.com

Clé d'API personnelle
oui
Modèles locaux
oui

Résultats mesurés

Des classements publics ont mesuré des modèles pilotés par mini-SWE-agent. Un même modèle n'obtient pas le même score d'un outil à l'autre : comparez avec les autres outils sur Le même modèle, des outils différents.

Claude Sonnet 4.5 sur Terminal-Bench 2.0

7 outils · écart de 6,5 points
  1. CAMEL-AIagent de recherche46,5 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  2. gooseoutil grand public43,1 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  3. Terminus 2outil de banc d'essai42,8 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  4. MAYA-V2autre agent42,7 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  5. OpenHandsoutil grand public42,6 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  6. mini-SWE-agentoutil de banc d'essai42,5 %modèle sorti le 29 septembre 2025 · source : tbench.ai
  7. Claude Codeoutil grand public40,1 %modèle sorti le 29 septembre 2025 · source : tbench.ai

GPT-5-Codex sur Terminal-Bench 2.0

3 outils · écart de 3,0 points
  1. Codex CLIoutil grand public44,3 %modèle sorti le 15 septembre 2025 · source : tbench.ai
  2. Terminus 2outil de banc d'essai43,4 %modèle sorti le 15 septembre 2025 · source : tbench.ai
  3. mini-SWE-agentoutil de banc d'essai41,3 %modèle sorti le 15 septembre 2025 · source : tbench.ai

Claude Opus 4.1 sur Terminal-Bench 2.0

4 outils · écart de 3,1 points
  1. Terminus 2outil de banc d'essai38,0 %modèle sorti le 5 août 2025 · source : tbench.ai
  2. OpenHandsoutil grand public36,9 %modèle sorti le 5 août 2025 · source : tbench.ai
  3. mini-SWE-agentoutil de banc d'essai35,1 %modèle sorti le 5 août 2025 · source : tbench.ai
  4. Claude Codeoutil grand public34,8 %modèle sorti le 5 août 2025 · source : tbench.ai

Le classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.

Les 14 comparaisons sur le comparateur →

Sources

Fiche relevée le sur 12 pages officielles. Une information que nous n'avons pas pu vérifier n'est jamais présentée comme un fait.

Ce que nous n'avons pas pu vérifier (3)
  • La documentation ne liste pas les systèmes pris en charge. PyPI indique seulement « OS Independent » et Python 3.10 ou plus ; les conteneurs de SWE-bench et de ProgramBench supposent un Linux x86.
  • Aucune page ne donne le pays de l'éditeur.
  • La documentation le présente à la fois comme un agent en ligne de commande pour le quotidien et comme un agent de référence pour les bancs d'essai. La fiche le range parmi les outils de banc d'essai.

Tous les outils →Le même modèle, des outils différents →Les abonnements d'IA →Signaler une erreur →

Cette fiche existe aussi en texte et en JSON.