mini-SWE-agent
mini-SWE-agent est un agent de code minimal, conçu par l'équipe de Princeton et Stanford qui a créé SWE-bench et SWE-agent.
En bref
- Ce que c'est
- mini-SWE-agent est un agent de code minimal, conçu par l'équipe de Princeton et Stanford qui a créé SWE-bench et SWE-agent. Son seul outil est le terminal (un shell bash) et il garde un historique linéaire. Cette simplicité en fait un agent de référence pour comparer des modèles sur SWE-bench (classement « bash only »). On l'utilise en ligne de commande (
mini) ou en lot sur un banc d'essai, et c'est aussi une bibliothèque Python pour programmer. - Éditeur
- Équipe SWE-agent (Princeton et Stanford)
- Prix
- gratuità l'usage
- Licence
- open source (MIT)
- Systèmes
- non précisé
- Formes
- ligne de commande, bibliothèque pour développeurs (SDK)
Site officiel de mini-SWE-agentFiche relevée le sur les pages officielles.
Installer
Tous systèmes (pip)
pip install mini-swe-agentTous systèmes (uv, environnement isolé)
uvx mini-swe-agentuv tool install mini-swe-agentTous systèmes (pipx, environnement isolé)
pipx run mini-swe-agentpipx install mini-swe-agentTous systèmes (depuis les sources)
git clone https://github.com/SWE-agent/mini-swe-agent.gitcd mini-swe-agentpip install -e .Paquets vérifiés sur leur registre : mini-swe-agent (pip).
Démarrer
Lancer mini : au premier lancement, un assistant demande le modèle par défaut et la clé d'API. On le relance plus tard avec mini-extra config setup. L'agent démarre en mode « confirm » : chaque commande proposée attend une validation.
minimini-extra config setupChoisir le modèle
On choisit le modèle avec -m ou --model, toujours précédé du fournisseur (par exemple anthropic/claude-…). Le modèle par défaut se règle avec mini-extra config set MSWEA_MODEL_NAME <modèle> ou avec la variable d'environnement MSWEA_MODEL_NAME.
mini -m <fournisseur/modèle>mini-extra config set MSWEA_MODEL_NAME <model-name>D'après la documentation officielle (mini-swe-agent.com), lue le . Les commandes sont recopiées telles quelles.
Ce qu'il sait faire
- Agent bash seul
- L'agent n'a aucun outil en dehors du terminal et se passe de la fonction d'appel d'outils des modèles : il tourne donc avec n'importe quel modèle. github.com
- Trois modes de travail
- Mode « confirm » (chaque action est validée), « yolo » (exécution directe) et « human » (l'utilisateur tape lui-même les commandes). On passe de l'un à l'autre avec
/c,/yet/u. mini-swe-agent.com - Évaluation en lot sur SWE-bench
mini-extra swebenchlance l'agent en parallèle sur toutes les tâches d'un sous-ensemble de SWE-bench. Pour le débogage,swebench-singletraite une seule tâche. mini-swe-agent.com- ProgramBench
mini-extra programbenchfait tourner l'agent sur les tâches de ProgramBench, avec une sortie lisible directement parprogrambench eval. mini-swe-agent.com- Bacs à sable
- L'agent s'exécute en local, dans Docker ou Podman, Singularity ou Apptainer, bubblewrap ou contree. github.com
- Lecteur de trajectoires
mini-extra inspectorouvre les fichiers.traj.jsonpour relire pas à pas l'historique d'une exécution. mini-swe-agent.com- Bibliothèque Python
- Les classes d'agent, de modèle et d'environnement s'importent dans un script Python : on construit ainsi sa propre boucle d'agent. mini-swe-agent.com
Les façons de l'utiliser
Sur téléphone
Au 3 octobre 2026, l'éditeur ne documente ni application mobile ni pilotage depuis un téléphone.
Prix et licence
Gratuit et open source (licence MIT). Les appels aux modèles sont facturés par le fournisseur choisi, avec la clé d'API de l'utilisateur.
Prix relevés le sur github.com, dans la devise de la page.
Licence
Open source, licence MIT. github.com
Modèles
Tous les modèles accessibles par LiteLLM (une bibliothèque qui unifie l'accès aux fournisseurs), plus OpenRouter et Portkey, avec la clé de l'utilisateur : Anthropic, OpenAI, Gemini, Mistral, DeepSeek, xAI, Groq… Les modèles locaux passent aussi par LiteLLM ; la documentation donne des exemples pour Ollama et vLLM. mini-swe-agent.com
- Clé d'API personnelle
- oui
- Modèles locaux
- oui
Résultats mesurés
Des classements publics ont mesuré des modèles pilotés par mini-SWE-agent. Un même modèle n'obtient pas le même score d'un outil à l'autre : comparez avec les autres outils sur Le même modèle, des outils différents.
- DeepSWE · GPT-6 Astra74,1 %
- DeepSWE · Gemini 3.8 Flash73,8 %
- DeepSWE · Claude Opus 573,6 %
- DeepSWE · GPT-5.6 Sol72,7 %
- DeepSWE · Claude Fable 569,9 %
- DeepSWE · GPT-5.6 Terra69,6 %
- DeepSWE · GLM-5.369,0 %
- DeepSWE · Kimi K368,5 %
- DeepSWE · Grok 4.667,5 %
- DeepSWE · GPT-5.6 Luna67,2 %
- DeepSWE · GPT-5.567,0 %
- DeepSWE · Gemini 3.7 Flash65,5 %
- DeepSWE · GLM-5.3-Flash63,4 %
- DeepSWE · Claude Opus 4.859,0 %
- DeepSWE · Qwen 3.8 Max57,5 %
- DeepSWE · Muse Spark 1.254,9 %
- DeepSWE · Claude Sonnet 553,8 %
- DeepSWE · Grok 4.553,8 %
- DeepSWE · Muse Spark 1.153,3 %
- DeepSWE · GPT-5.451,8 %
- DeepSWE · Gemini 3.6 Flash46,7 %
- DeepSWE · GLM-5.243,8 %
- DeepSWE · Gemini 3.5 Flash37,4 %
- DeepSWE · Kimi K2.7 Code30,5 %
- DeepSWE · Claude Sonnet 4.629,9 %
- DeepSWE · Gemini 3.1 Pro11,7 %
- FrontierCode · Kimi K344,2 %
- FrontierCode · Kimi K2.7 Code30,1 %
- FrontierCode · GLM-5.224,5 %
- FrontierCode · DeepSeek-V4-Pro17,6 %
- FrontierCode · MiniMax-M314,7 %
- FrontierCode · Inkling14,0 %
- FrontierCode · Qwen3.7-Plus10,2 %
- Terminal-Bench 2.0 · Claude Sonnet 4.542,5 %6e sur 7 outils
- Terminal-Bench 2.0 · GPT-5-Codex41,3 %3e sur 3 outils
- Terminal-Bench 2.0 · Claude Opus 4.135,1 %3e sur 4 outils
- Terminal-Bench 2.0 · GPT-533,9 %4e sur 4 outils
- Terminal-Bench 2.0 · Claude Haiku 4.529,8 %2e sur 5 outils
- Terminal-Bench 2.0 · Gemini 2.5 Pro (Jun 2025)26,1 %2e sur 4 outils
- Terminal-Bench 2.0 · grok-code-fast-125,8 %1er sur 2 outils
- Terminal-Bench 2.0 · Grok 425,4 %2e sur 3 outils
- Terminal-Bench 2.0 · GPT-5 mini22,2 %5e sur 5 outils
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Sep 2025)17,1 %1er sur 4 outils
- Terminal-Bench 2.0 · Gemini 2.5 Flash (Jun 2025)17,1 %1er sur 4 outils
- Terminal-Bench 2.0 · gpt-oss-120b14,2 %2e sur 2 outils
- Terminal-Bench 2.0 · GPT-5 nano7,0 %5e sur 5 outils
- Terminal-Bench 2.0 · gpt-oss-20b3,4 %1er sur 2 outils
Claude Sonnet 4.5 sur Terminal-Bench 2.0
7 outils · écart de 6,5 pointsGPT-5-Codex sur Terminal-Bench 2.0
3 outils · écart de 3,0 pointsClaude Opus 4.1 sur Terminal-Bench 2.0
4 outils · écart de 3,1 pointsLe classement Terminal-Bench date chaque ligne du jour de sortie du modèle et ne publie pas la date de chaque mesure.
Sources
Fiche relevée le sur 12 pages officielles. Une information que nous n'avons pas pu vérifier n'est jamais présentée comme un fait.
- github.com/SWE-agent/mini-swe-agent
- mini-swe-agent.com/latest/
- mini-swe-agent.com/latest/quickstart/
- pypi.org/project/mini-swe-agent/
- mini-swe-agent.com/latest/models/quickstart/
- mini-swe-agent.com/latest/usage/mini/
- mini-swe-agent.com/latest/usage/swebench/
- mini-swe-agent.com/latest/usage/programbench/
- mini-swe-agent.com/latest/usage/inspector/
- mini-swe-agent.com/latest/usage/python_bindings/
- github.com/SWE-agent/mini-swe-agent/blob/main/LICENSE.md
- mini-swe-agent.com/latest/models/local_models/
Ce que nous n'avons pas pu vérifier (3)
- La documentation ne liste pas les systèmes pris en charge. PyPI indique seulement « OS Independent » et Python 3.10 ou plus ; les conteneurs de SWE-bench et de ProgramBench supposent un Linux x86.
- Aucune page ne donne le pays de l'éditeur.
- La documentation le présente à la fois comme un agent en ligne de commande pour le quotidien et comme un agent de référence pour les bancs d'essai. La fiche le range parmi les outils de banc d'essai.
Tous les outils →Le même modèle, des outils différents →Les abonnements d'IA →Signaler une erreur →