Labo de projets LLM : 20 projets, du premier appel d'API à l'agent en production
Vingt projets LLM concrets en quatre niveaux, avec étapes et prompt de départ, pour passer de votre premier appel d'API à un agent prêt pour la production.
par Patrick Kamtchueng Kom · Publié
Lire sur les LLM, ça a ses limites. La meilleure façon d’apprendre, c’est de bâtir de petits projets réels, chacun ajoutant une seule nouvelle compétence à la précédente.
Ce labo, c’est le parcours que je fais faire aux développeurs : quatre stations, cinq projets chacune. Choisissez votre point de départ, bâtissez, cochez.
Par où commencer?
Soyez honnête, c’est vous que ça aide. Votre score vous oriente vers un niveau dans l’explorateur plus bas.
📊 Par où commencer?
1. J'ai déjà appelé une API de LLM (ou un modèle local) à partir de mon propre code et traité la réponse.
Pas encoreSans problème2. Je suis capable d'obtenir du modèle un JSON valide que mon code parse et valide à tout coup.
Pas encoreSans problème3. J'ai déjà donné un outil (ou une fonction) à appeler à un modèle et branché le résultat.
Pas encoreSans problème4. J'ai déjà bâti de la recherche sur mes propres documents (chunking, embeddings, recherche) avec citation des sources.
Pas encoreSans problème5. Je mesure la qualité avec un petit jeu d'evals avant et après un changement de prompt ou de modèle.
Pas encoreSans problème
Les 20 projets
Filtrez par niveau ou par compétence, ou cliquez sur « Au hasard ». Chaque carte contient les étapes et un prompt de départ pour votre agent de code.
🧭 Labo de projets LLM
20 affichés · 0 / 20 terminé
Rédacteur de messages de commit
Niveau 1~2 hPrompting · Déploiement
Un CLI qui lit votre diff indexé et propose un message de commit clair. Vous apprenez les prompts système, les limites de contexte et comment réduire l'entrée.
▸ Détails
- Écrivez un script qui récupère le diff indexé sous forme de texte.
- Envoyez-le à n'importe quelle API de LLM ou à un modèle local avec un prompt système qui décrit votre style de commit.
- Tronquez ou résumez les très gros diffs pour rester sous la limite de contexte.
- Affichez la suggestion et laissez l'utilisateur l'accepter, la modifier ou la rejeter.
- Ajoutez un hook git ou un alias pour le lancer en une commande.
Prompt de départ
Bâtis un petit CLI en [LANGAGE] qui lit la sortie du diff git indexé, l'envoie à un LLM ([FOURNISSEUR OU MODÈLE LOCAL]) avec un prompt système qui impose [CONVENTION DE COMMIT], et affiche un message de commit proposé. Tronque les diffs de plus de [N] caractères avec une note. Permets d'accepter (o), modifier (m) ou annuler (n). Garde la clé d'API dans une variable d'environnement. Inclus un README avec les étapes d'installation.
Explicateur de stack traces
Niveau 1~2 hPrompting
Collez une erreur, obtenez une explication en langage clair et trois causes probables. Vous apprenez la structure d'un prompt, les exemples few-shot et le format de sortie.
▸ Détails
- Créez un CLI simple ou un formulaire web qui accepte une stack trace.
- Rédigez un prompt avec une structure fixe : résumé, causes probables, quoi vérifier en premier.
- Ajoutez deux courts exemples few-shot de bonnes explications.
- Comparez les réponses avec et sans exemples sur cinq vraies erreurs.
- Conservez la meilleure version du prompt dans un fichier versionné.
Prompt de départ
Crée un [CLI OU PETITE APP WEB] en [LANGAGE] qui prend une stack trace collée et demande à un LLM ([FOURNISSEUR OU MODÈLE LOCAL]) de retourner : un résumé d'une phrase, trois causes probables classées, et la première chose à vérifier. Mets le gabarit de prompt dans un fichier séparé avec deux exemples few-shot modifiables. Ajoute une option pour rouler sans les exemples afin de comparer.
Banc d'essai de modèles
Niveau 1~3 hPrompting · Modèles locaux · Evals
Envoyez le même prompt à deux modèles côte à côte et notez la latence, les tokens et la sortie. Vous apprenez en quoi les modèles diffèrent et ce que coûte vraiment un appel.
▸ Détails
- Configurez l'accès à une API de LLM hébergée et à un modèle local.
- Bâtissez une page ou un CLI qui envoie un prompt aux deux en même temps.
- Enregistrez la latence et le nombre de tokens en entrée et en sortie pour chaque appel.
- Estimez le coût par appel à partir de la tarification actuelle de votre fournisseur.
- Sauvegardez chaque essai dans un fichier CSV pour comparer plus tard.
Prompt de départ
Bâtis un [CLI OU PAGE WEB SIMPLE] en [LANGAGE] qui envoie un prompt en parallèle à deux backends : [MODÈLE HÉBERGÉ] et [MODÈLE LOCAL]. Affiche les deux réponses côte à côte avec la latence et le nombre de tokens. Lis le prix par token dans un fichier de config et affiche le coût estimé. Ajoute chaque essai (horodatage, prompt, modèle, latence, tokens, coût, sortie) à runs.csv.
Notes de réunion en actions
Niveau 1~2 hPrompting
Transformez des notes de réunion brutes en décisions, responsables et échéances. Vous apprenez à donner des consignes précises et à gérer une entrée ambiguë.
▸ Détails
- Rassemblez trois ou quatre jeux de notes de réunion réelles ou réalistes.
- Rédigez un prompt qui demande les décisions, actions, responsables et dates.
- Dites au modèle quoi faire quand un responsable ou une date manque.
- Affichez le résultat sous forme de liste de tâches en markdown.
- Ajustez le prompt jusqu'à ce qu'aucune action ne soit inventée.
Prompt de départ
Écris un script en [LANGAGE] qui lit un fichier texte de notes de réunion et demande à un LLM ([FOURNISSEUR OU MODÈLE LOCAL]) d'en extraire les décisions et les actions avec responsable et échéance. Si le responsable ou la date n'est pas mentionné, la sortie doit indiquer « non assigné » ou « sans date », sans jamais deviner. Produis une liste de tâches en markdown. Inclus trois fichiers de notes d'exemple dans /samples.
Chat en streaming dans le terminal
Niveau 1~3 hPrompting · Mémoire
Un client de chat dans votre terminal qui affiche les tokens en streaming et garde l'historique. Vous apprenez les rôles de messages, le streaming et la gestion de la fenêtre de contexte.
▸ Détails
- Bâtissez une boucle qui lit l'entrée et envoie l'historique des messages au modèle.
- Affichez la réponse token par token dans le terminal.
- Comptez les tokens et retirez ou résumez les anciens échanges quand vous approchez la limite.
- Ajoutez les commandes /reset et /system pour modifier la conversation.
- Sauvegardez les conversations dans un fichier local à la sortie.
Prompt de départ
Bâtis une app de chat en terminal en [LANGAGE] qui parle à [FOURNISSEUR OU MODÈLE LOCAL] avec sortie en streaming. Garde l'historique complet et, au-delà de [N] tokens, résume les échanges les plus anciens en un seul message. Prends en charge les commandes : /reset, /system [TEXTE], /save. Garde le code dans moins de [N] fichiers avec des commentaires clairs.
Extracteur de données de factures
Niveau 2~4 hSorties structurées
Extrayez fournisseur, date, totaux et lignes d'une facture en JSON validé. Vous apprenez les schémas, la validation et la relance quand la sortie est invalide.
▸ Détails
- Définissez un schéma pour les champs voulus, avec types et champs obligatoires.
- Demandez au modèle de répondre uniquement en JSON conforme au schéma.
- Validez chaque réponse dans le code; en cas d'échec, relancez une fois avec le message d'erreur.
- Testez sur dix factures d'exemple, dont une vraiment brouillonne.
- Notez quels champs échouent le plus souvent et ajustez le prompt.
Prompt de départ
Crée un module [LANGAGE] qui prend le texte d'une facture et retourne un JSON conforme à ce schéma : [COLLE LE SCHÉMA : vendor, invoice_date, currency, subtotal, tax, total, line_items]. Utilise [FOURNISSEUR OU MODÈLE LOCAL]. Valide la réponse avec [BIBLIOTHÈQUE DE VALIDATION]; si elle est invalide, relance une fois en incluant les erreurs de validation. Ajoute des tests avec [N] factures d'exemple dans /fixtures et rapporte la précision par champ.
Trieur de tickets
Niveau 2~4 hSorties structurées · Evals
Classez les nouveaux tickets par type, composant et priorité, avec un score de confiance. Vous apprenez les prompts de classification, les listes fermées et quand passer la main à un humain.
▸ Détails
- Exportez 30 tickets existants avec leurs étiquettes comme vérité de référence.
- Demandez au modèle une étiquette tirée d'une liste fixe et une valeur de confiance.
- Envoyez les résultats peu confiants dans une file « à réviser ».
- Mesurez la précision par rapport à votre vérité de référence.
- Essayez un changement de prompt et comparez les chiffres.
Prompt de départ
Bâtis un script [LANGAGE] qui lit des tickets depuis [SOURCE : CSV OU EXPORT DU GESTIONNAIRE DE TICKETS] et demande à un LLM de classer chacun par type [LISTE], composant [LISTE] et priorité [LISTE], en retournant un JSON avec une confiance entre 0 et 1. Tout ce qui est sous [SEUIL] va dans needs_review. Compare avec la colonne d'étiquettes existante et affiche un tableau de précision par champ.
Langage naturel vers SQL (lecture seule)
Niveau 2~5 hOutils · Sorties structurées
Posez des questions en français à une base de données d'exemple. Vous apprenez l'appel d'outils, le contexte de schéma et les garde-fous stricts.
▸ Détails
- Chargez une petite base d'exemple et connectez-vous avec un utilisateur en lecture seule.
- Donnez au modèle le schéma des tables et un seul outil : exécuter une requête SELECT.
- Rejetez tout ce qui n'est pas un unique SELECT avant l'exécution.
- Renvoyez les lignes au modèle et laissez-le répondre en langage clair.
- Montrez toujours le SQL généré à l'utilisateur.
Prompt de départ
Bâtis une app [LANGAGE] qui répond à des questions en langage naturel sur une base de données [TYPE DE BD]. Expose un seul outil au LLM : run_select(sql). Fournis le schéma dans le prompt système. Avant l'exécution, analyse le SQL et rejette tout ce qui n'est pas un unique SELECT; connecte-toi avec un utilisateur en lecture seule et un délai de [N] secondes. Affiche le SQL, les lignes (max [N]) et la réponse du modèle.
Assistant multi-outils
Niveau 2~4 hOutils
Un assistant avec trois petits outils (calculatrice, calcul de dates, une API publique de votre choix). Vous apprenez la conception d'outils, la validation des arguments et la boucle d'outils.
▸ Détails
- Écrivez trois outils avec des noms et descriptions courts et sans ambiguïté.
- Implémentez la boucle : le modèle demande un outil, vous l'exécutez, vous renvoyez le résultat.
- Validez les arguments et retournez des erreurs claires dont le modèle peut se remettre.
- Plafonnez la boucle à un nombre fixe d'étapes.
- Journalisez chaque appel d'outil avec ses arguments et son résultat.
Prompt de départ
Bâtis un assistant en [LANGAGE] avec [FOURNISSEUR OU MODÈLE LOCAL QUI SUPPORTE LES OUTILS] et trois outils : calculate(expression), date_diff(start, end) et [TON OUTIL](args). Implémente la boucle d'appel d'outils à la main, plafonne-la à [N] itérations, valide les arguments et retourne des messages d'erreur exploitables par le modèle. Affiche une trace de chaque appel. Ajoute cinq questions d'exemple qui demandent plus d'un outil.
Résumeur de PR
Niveau 2~5 hSorties structurées · Prompting
Résumez le diff d'une pull request : ce qui a changé, pourquoi c'est important et quoi réviser. Vous apprenez à découper une longue entrée et à produire des résumés structurés constants.
▸ Détails
- Récupérez le diff d'une PR et découpez-le par fichier.
- Résumez les gros fichiers un par un, puis combinez en un seul résumé.
- Retournez une structure fixe : vue d'ensemble, changements à risque, ordre de révision suggéré.
- Publiez le résumé en commentaire ou affichez-le localement.
- Comparez le résumé avec ce qu'un collègue écrirait, sur trois PR.
Prompt de départ
Crée un outil [LANGAGE] qui prend le diff d'une PR (depuis un fichier ou l'API de [HÉBERGEUR DE CODE]), le découpe par fichier, résume séparément les fichiers de plus de [N] lignes, puis produit un JSON avec : overview, changes_by_area, risky_changes (avec fichier et raison), review_order. Affiche-le en markdown. Utilise [FOURNISSEUR OU MODÈLE LOCAL]. N'inclus jamais dans la sortie un secret trouvé dans le diff.
Assistant de documentation interne
Niveau 3~1 jourRAG
Posez des questions sur la documentation de votre équipe et obtenez des réponses avec citations. Vous apprenez le chunking, les embeddings, la recherche et les réponses ancrées dans les sources.
▸ Détails
- Rassemblez de 20 à 50 documents markdown ou texte.
- Découpez-les en chunks en gardant les titres comme contexte, puis calculez les embeddings.
- Stockez les vecteurs dans une base vectorielle locale ou une extension de base de données.
- Récupérez les meilleurs chunks pour une question et passez-les au modèle.
- Exigez des citations et un « je ne sais pas » quand la doc ne couvre pas le sujet.
Prompt de départ
Bâtis un assistant RAG en [LANGAGE] sur les fichiers markdown de [DOSSIER]. Découpe par titre avec un max de [N] tokens, garde le chemin du fichier et le titre en métadonnées, calcule les embeddings avec [MODÈLE D'EMBEDDING], stocke dans [BASE VECTORIELLE]. Pour chaque question, récupère les [K] meilleurs chunks et demande à [FOURNISSEUR OU MODÈLE LOCAL] de répondre uniquement à partir de ceux-ci, en citant fichier et titre, et de dire qu'il ne sait pas sinon. Ajoute une commande /reindex.
Harnais d'evals pour votre RAG
Niveau 3~5 hEvals · RAG
Une petite suite de tests qui note votre assistant de doc sur de vraies questions. Vous apprenez les jeux de référence, les métriques de recherche et le LLM-juge utilisé avec prudence.
▸ Détails
- Rédigez 25 questions avec le document source attendu et une réponse de référence.
- Vérifiez si le bon document apparaît parmi les chunks récupérés.
- Notez les réponses avec des vérifications simples d'abord, puis un LLM-juge avec une grille stricte.
- Comparez le juge à votre propre correction sur dix réponses.
- Roulez la suite à chaque changement de prompt ou de chunking et sauvegardez les résultats.
Prompt de départ
Crée un harnais d'evals en [LANGAGE] pour mon app RAG à [CHEMIN OU POINT D'ENTRÉE]. Lis les cas dans evals.yaml (question, expected_source, reference_answer). Pour chaque cas, note si expected_source est dans les [K] premiers chunks récupérés, et évalue la réponse avec un LLM-juge selon cette grille : [GRILLE]. Produis un tableau et un fichier JSON de résultats horodaté pour comparer les exécutions.
Assistant avec mémoire à long terme
Niveau 3~6 hMémoire · RAG
Un assistant personnel qui se souvient de vos préférences d'une session à l'autre. Vous apprenez quoi mémoriser, comment le retrouver et comment laisser l'utilisateur le modifier.
▸ Détails
- Après chaque conversation, demandez au modèle d'extraire les faits durables à conserver.
- Stockez ces faits avec un horodatage dans une base de données locale.
- Récupérez les faits pertinents au début de chaque nouvelle conversation.
- Ajoutez des commandes pour lister, modifier et supprimer les souvenirs.
- Gérez les conflits : les faits récents remplacent les anciens.
Prompt de départ
Bâtis un assistant de chat en [LANGAGE] avec une mémoire à long terme stockée dans [SQLITE OU AUTRE]. À la fin de chaque session, demande au LLM d'extraire jusqu'à [N] faits durables sur l'utilisateur en JSON. Au début de chaque session, récupère les [K] faits les plus pertinents par similarité d'embeddings et inclus-les dans le prompt système. Ajoute les commandes /memories, /forget [ID] et /edit [ID]. Un fait récent sur le même sujet remplace l'ancien.
Questions-réponses sur une base de code
Niveau 3~1 jourRAG · Outils
Demandez « où est géré X? » dans un dépôt et obtenez des réponses au niveau des fichiers. Vous apprenez le chunking adapté au code et la recherche hybride mots-clés et vecteurs.
▸ Détails
- Parcourez un dépôt et découpez les fichiers par fonction ou classe quand c'est possible.
- Indexez les chunks avec des embeddings et un index par mots-clés.
- Fusionnez les résultats des deux recherches avant de les envoyer au modèle.
- Retournez des réponses avec chemins de fichiers et plages de lignes.
- Comparez la recherche hybride à la recherche vectorielle seule sur dix questions.
Prompt de départ
Bâtis un outil de questions-réponses en [LANGAGE] pour le dépôt à [CHEMIN]. Découpe les fichiers source par fonction ou classe (sinon : [N] lignes), garde le chemin et la plage de lignes. Indexe avec des embeddings dans [BASE VECTORIELLE] et un index par mots-clés. Fusionne les deux listes de résultats, envoie les [K] meilleurs chunks à [FOURNISSEUR OU MODÈLE LOCAL] et réponds avec des citations fichier:ligne. Ajoute une option pour basculer entre hybride et vectoriel seul afin de comparer.
Recherche de notes 100 % locale
Niveau 3~5 hRAG · Modèles locaux
Du RAG sur vos notes personnelles qui ne quitte jamais votre portable. Vous apprenez les embeddings locaux, les petits modèles et les compromis de qualité qui viennent avec.
▸ Détails
- Faites rouler un modèle local et un modèle d'embedding local sur votre machine.
- Indexez votre dossier de notes et surveillez-le pour les changements.
- Répondez aux questions en citant les titres des notes.
- Essayez deux tailles de modèle et comparez vitesse et qualité des réponses.
- Vérifiez qu'aucun appel réseau n'est fait pendant l'exécution.
Prompt de départ
Bâtis une recherche de notes entièrement hors ligne en [LANGAGE] sur [DOSSIER DE NOTES] avec [ENVIRONNEMENT DE MODÈLES LOCAUX] pour les embeddings et la génération. Surveille le dossier et réindexe les fichiers modifiés. Réponds aux questions en citant les titres des notes. Ajoute une option de config pour passer de [PETIT MODÈLE] à [MODÈLE PLUS GROS] et affiche le temps de génération de chaque réponse.
Agent de triage de logs
Niveau 4~2 joursAgents · Outils
Un agent qui lit les logs d'erreurs récents, les regroupe, vérifie les derniers déploiements et rédige un résumé d'incident. Vous apprenez la planification en plusieurs étapes avec des outils en lecture seule.
▸ Détails
- Donnez à l'agent des outils en lecture seule : chercher dans les logs, lister les déploiements récents, lire un fichier.
- Laissez-le regrouper les erreurs par signature et choisir les principaux problèmes.
- Demandez un résumé avec une preuve pour chaque affirmation.
- Plafonnez les étapes, les tokens et le temps par exécution.
- Révisez cinq exécutions réelles et resserrez les descriptions d'outils.
Prompt de départ
Bâtis un agent de triage de logs en [LANGAGE] avec [FOURNISSEUR OU MODÈLE LOCAL QUI SUPPORTE LES OUTILS]. Outils (tous en lecture seule) : search_logs(query, since), list_deploys(since), read_file(path). L'agent regroupe les erreurs par signature, choisit les [N] principales, vérifie si elles ont commencé après un déploiement, et rédige un résumé d'incident en markdown où chaque affirmation cite une ligne de log ou un déploiement. Limite à [N] étapes et [N] tokens par exécution et affiche une trace complète.
Agent de correction de tests en bac à sable
Niveau 4~2 joursAgents · Outils · Déploiement
Un agent qui roule votre suite de tests, lit les échecs et propose un correctif dans un conteneur. Vous apprenez l'isolation, les boucles de rétroaction et l'approbation humaine.
▸ Détails
- Faites rouler le projet dans un conteneur jetable, sans aucun secret.
- Donnez à l'agent des outils pour rouler les tests, lire des fichiers et écrire un correctif.
- Boucle : rouler les tests, lire l'échec, modifier, relancer, avec une limite d'étapes stricte.
- Produisez un diff qu'un humain approuve, jamais de fusion automatique.
- Mesurez à quelle fréquence les correctifs passent sur un ensemble de bogues semés.
Prompt de départ
Bâtis un agent en [LANGAGE] qui corrige les tests en échec de [DÉPÔT] dans un conteneur [ENVIRONNEMENT DE CONTENEURS] jetable, sans réseau ni secrets. Outils : run_tests(), read_file(path), write_file(path, content). Boucle jusqu'à [N] fois : rouler les tests, lire l'échec, modifier, relancer. À la fin, produis un diff unifié et une courte explication pour révision humaine. Inclus [N] bogues semés pour mesurer le taux de réussite.
Agent de recherche avec budget
Niveau 4~2 joursAgents · RAG · Evals
Un agent qui découpe une question en sous-questions, cherche dans vos documents et rédige une synthèse sourcée dans un budget fixe. Vous apprenez la planification et le contrôle des coûts.
▸ Détails
- Demandez d'abord à l'agent un court plan de sous-questions.
- Répondez à chaque sous-question par une recherche dans votre corpus.
- Suivez les tokens et le coût par étape et arrêtez au budget.
- Rédigez une synthèse finale où chaque paragraphe cite ses sources.
- Évaluez les synthèses sur dix questions pour la couverture et l'exactitude des citations.
Prompt de départ
Bâtis un agent de recherche en [LANGAGE] qui prend une question, rédige un plan d'au plus [N] sous-questions, répond à chacune par une recherche dans [CORPUS OU INDEX], puis rédige une synthèse avec des citations par paragraphe. Suis les tokens et le coût estimé par étape; arrête-toi et résume ce que tu as quand tu atteins [BUDGET]. Sauvegarde le plan, chaque étape et la synthèse finale dans un fichier de trace JSON.
Passerelle LLM de production
Niveau 4~2 joursDéploiement · Evals
Un petit service devant vos appels de LLM qui ajoute tracing, cache, limites de débit et solutions de repli. Vous apprenez la plomberie dont toute app en production a besoin.
▸ Détails
- Placez un seul point d'entrée interne devant tous vos appels de modèle.
- Journalisez chaque requête avec un ID de trace, la latence, les tokens et le coût.
- Ajoutez un cache pour les requêtes identiques et une limite de débit par utilisateur.
- Basculez vers un second modèle quand le premier expire ou plante.
- Bâtissez un tableau de bord simple du coût et du taux d'erreur par jour.
Prompt de départ
Bâtis un service de passerelle HTTP en [LANGAGE] qui relaie les requêtes de LLM vers [FOURNISSEUR PRINCIPAL] avec repli sur [FOURNISSEUR SECONDAIRE OU MODÈLE LOCAL]. Ajoute : tracing des requêtes (ID de trace, latence, tokens, coût estimé) vers [STOCKAGE DE LOGS], un cache par correspondance exacte avec [TTL], des limites de débit par clé d'API et des délais de [N] secondes. Expose /metrics avec le coût quotidien et le taux d'erreur. Inclus un Dockerfile et des tests pour le chemin de repli.
Copilote de réponses au support
Niveau 4~3 joursAgents · RAG · Evals
Rédige des réponses aux tickets de support à partir de votre centre d'aide, avec un humain qui approuve chaque envoi. Vous apprenez les garde-fous, les règles d'escalade et les evals de bout en bout.
▸ Détails
- Pour chaque nouveau ticket, récupérez les articles d'aide pertinents et des tickets résolus similaires.
- Rédigez une réponse avec citations et un niveau de confiance.
- Escaladez automatiquement pour les remboursements, les sujets juridiques ou les clients fâchés.
- Gardez une étape d'approbation humaine avant tout envoi.
- Suivez à quelle fréquence les agents modifient beaucoup les brouillons et utilisez-le comme signal d'eval.
Prompt de départ
Bâtis un copilote de réponses au support en [LANGAGE]. Pour chaque ticket provenant de [SOURCE], récupère les [K] meilleurs articles d'aide et des tickets résolus similaires, puis rédige une réponse avec citations et un score de confiance. Escalade (sans brouillon) quand le ticket mentionne [SUJETS D'ESCALADE]. Affiche les brouillons dans une interface de révision simple avec approuver, modifier et rejeter; journalise la distance d'édition entre le brouillon et la réponse envoyée pour l'évaluation.
La boucle de construction
Chaque projet, à chaque niveau, passe par la même boucle. Ne sautez pas le jeu d’evals : c’est lui qui transforme une démo en quelque chose de fiable.
- PrototypeUn premier cas nominal qui marche de bout en bout
- Jeu d'evals10 à 30 vrais cas avec résultats attendus
- RenforcerValidation, limites, erreurs, tracing
- LivrerVrais utilisateurs, logs actifs, coûts surveillés
↺ Les nouveaux échecs deviennent de nouveaux cas d'eval
Testez vos réflexes
Quatre questions sur des décisions que vous prendrez en bâtissant ces projets.
🧠 Décisions de conception LLM
Pointage: 0 / 4
1. Votre assistant doit répondre à des questions sur 2 000 documents internes qui changent chaque semaine. Quelle est la meilleure première approche?
2. Quelle définition d'outil le modèle a-t-il le plus de chances d'utiliser correctement?
3. Vous avez modifié votre prompt et les trois réponses que vous avez vérifiées sont meilleures. Que faire avant de livrer?
4. Le coût mensuel de votre agent a soudainement doublé. Quelle est la première étape la plus utile?
Livrez-le
Cochez ces points avant de déclarer un projet du labo terminé.
✅ Avant de dire qu'un projet est terminé
0 / 8 complété