Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

RunInfra

Retour au répertoire

RunInfra

Freemium Website 🚀 2026 11 clics Vérifié · il y a 1 sem.

En bref

RunInfra est une plateforme d'inférence IA centrée sur les modèles open source, offrant une interface conversationnelle pour choisir un modèle, benchmarker sur GPU réels, optimiser le runtime et dé...

Mis à jour le 2026-08-28

Capture d'écran de RunInfra
💰 Tarification
Freemium
🌐 Type
Website
🚀 Lancé en
2026
📁 Catégories
🎯 Public
Développeurs, Entreprises
🔗 Site web
runinfra.ai/
✓ Vérifié par La veille Mis à jour le 28 août 2026

👋 À propos de RunInfra

À propos de RunInfra

RunInfra est une plateforme d'inférence IA centrée sur les modèles open source, offrant une interface conversationnelle pour choisir un modèle, benchmarker sur GPU réels, optimiser le runtime et déployer une API compatible OpenAI prête pour la production. La plateforme se distingue par sa capacité à transformer une description en langage naturel en un pipeline d'inférence complet et optimisé.

Lancée en avril 2026, RunInfra propose des fonctionnalités avancées telles que des benchmarks mesurés, des runbooks durables, des endpoints audio, un démarrage à froid réduit grâce à Instant Start, et la prise en charge de multiples types de pipelines IA. La plateforme s'adresse aux équipes techniques souhaitant industrialiser des modèles open source sans gérer elles-mêmes l'optimisation GPU et l'infrastructure d'inférence.

Fonctionnalités principales

Construction de pipeline par dialogue L'utilisateur décrit son besoin en langage naturel, et RunInfra construit le pipeline, sélectionne les modèles appropriés et déploie l'API correspondante. Cette approche réduit considérablement le temps de mise en production.

Benchmark GPU réel La plateforme teste plusieurs modèles et configurations sur des GPU concrets avant le déploiement, permettant de comparer les performances réelles plutôt que des estimations théoriques.

Optimisation automatique RunInfra génère des kernels Triton, applique la quantization (AWQ, GPTQ, FP8), utilise RunQuant, le décodage spéculatif et le routage intelligent pour optimiser les performances et réduire les coûts.

Déploiement compatible OpenAI Les endpoints HTTP générés sont compatibles avec les API OpenAI, facilitant l'intégration dans les applications existantes.

Mise à l'échelle flexible La plateforme supporte le scale-to-zero, les endpoints flexibles et l'option always-on selon les besoins.

Types de workloads pris en charge RunInfra gère les LLM, les embeddings, le speech-to-text, le text-to-speech, les modèles vision-language et la génération d'images.

Tarification

RunInfra propose trois plans tarifaires, combinant abonnements, crédits et facturation à l'usage.

Plan Starter Gratuit, ce plan inclut le constructeur par dialogue avec le catalogue Hugging Face complet, 3 runs d'optimisation d'essai par mois, un playground de pipeline avec 100 requêtes par jour, et la construction et le test de pipelines sans déploiement.

Plan Pro À 49 $ US par mois (≈ 67 $ CA/mois, facturé ~49 $ US), ce plan offre 50 $ US en crédits d'optimisation par mois (ou 600 $ US versés d'avance en annuel). Il inclut un crédit d'inférence pay-per-million-token avec rechargement, une API compatible OpenAI à 500 req/min, des endpoints scale-to-zero avec démarrage à froid annoncé sous 2 secondes, un sélecteur GPU personnalisé (T4, L4, A100, H100, H200, B200), la suite d'optimisation complète (AWQ, GPTQ, FP8, RunQuant), des pipelines illimités, jusqu'à 8 réplicas, 90 jours de métriques, un SLA de 99,9 % et un support prioritaire.

Plan Enterprise Tarif sur mesure, ce plan offre une capacité GPU réservée, un SLA personnalisé jusqu'à 99,99 %, une API compatible OpenAI à partir de 50 000 req/min avec plafonds personnalisés, une tarification au volume avec jusqu'à 40 % de remise, un upload sécurisé de modèles à grande échelle, des métriques illimitées, un gestionnaire de compte dédié et un canal Slack privé.

Tarification à l'usage La page d'accueil indique un tarif d'inférence de 0,27 $ US par million de tokens d'entrée et 0,27 $ US par million de tokens de sortie (≈ 0,37 $ CA par million de tokens). Le coût réel dépend du plan choisi, du volume de tokens et des GPU sélectionnés.

Cas d'utilisation

Agents vocaux RunInfra permet de combiner STT, LLM et TTS en flux continu pour créer des agents vocaux interactifs.

Assistants IA La plateforme supporte les assistants avec outils, streaming et sorties structurées pour des applications de chatbot avancées.

Embeddings et reranking RunInfra facilite la recherche sémantique et le reranking en un seul aller-retour pour les systèmes de recommandation.

Recherche RAG La génération ancrée avec recherche hybride et citations auditables permet de construire des systèmes de question-réponse documentaires.

Document AI L'extraction de PDF et de formulaires vers JSON via des modèles vision-language automatise le traitement documentaire.

Transcription Le service Whisper avec diarisation et rédaction de données personnelles offre une solution de transcription complète.

Notre avis

Points forts RunInfra se distingue par un gain de temps significatif : le pipeline est construit et optimisé à partir d'une simple description en langage naturel. L'optimisation profonde, incluant des kernels sur mesure, la quantization et les benchmarks comparatifs, réduit la latence et les coûts GPU.

Le déploiement simplifié avec une API compatible OpenAI et le scale-to-zero facilite la mise en production. La large couverture de modèles open source et de GPU allant de T4 à B200 offre une flexibilité appréciable. Le positionnement production avec métriques, SLA et runbooks durables rassure les équipes techniques.

Points faibles La plateforme est résolument orientée open source, ce qui limite son usage pour les équipes utilisant des modèles propriétaires. La complexité tarifaire, combinant abonnements, crédits, facturation par tokens et coûts GPU, peut rendre le budget moins lisible qu'un forfait simple.

Les fonctionnalités avancées sont concentrées sur les plans Pro et Enterprise, le plan gratuit servant principalement à tester. Enfin, la plateforme est récente malgré des fonctionnalités déjà orientées production, ce qui peut susciter des interrogations sur sa maturité.

Public cible RunInfra s'adresse aux startups IA souhaitant sortir rapidement une API de production sans monter une infrastructure GPU complète, aux équipes produit et ML ayant besoin d'itérer sur des pipelines RAG, assistants, transcription ou agents vocaux, aux PME et équipes techniques cherchant à optimiser leurs coûts d'inférence open source, ainsi qu'aux entreprises avec des besoins de SLA, réserves de capacité, sécurité et volume important.

Alternatives Le self-hosting avec vLLM, TensorRT-LLM ou Triton offre plus de contrôle mais nécessite davantage d'opérations et de maintenance. Les services cloud comme Google Cloud Run conviennent pour certaines charges IA mais ne sont pas des équivalents directs d'une plateforme d'optimisation d'inférence open source. Le marché inclut plusieurs services de serving GPU et d'inférence serverless, mais leurs fonctionnalités et prix varient considérablement.

💡 Les prix affichés sont indicatifs et convertis approximativement en dollars canadiens ($ CA). La facturation réelle peut être effectuée dans une autre devise (souvent en $ US) par le fournisseur. Vérifiez le prix exact sur le site officiel.

🎯 Public cible

Développeurs Entreprises Data scientists Freelances

Envie d'essayer RunInfra ?

Visiter le site →
✓ Vérifié par La veille
👋

Soyez le premier à donner votre avis !

Partagez votre expérience avec cet outil pour aider la communauté.

💬

C'est calme ici...

Lancez une discussion ! Quelle est votre expérience ?

📚

Aucun tutoriel pour le moment

Connaissez-vous un bon tutoriel ? Partagez-le !

📸 Screenshots de la communauté

📷

Aucun screenshot pour le moment. Soyez le premier a en partager !

Aucune alternative pour le moment.

/
🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !