Skip to content
PKResources
Rapports

Comment les équipes d’ingénierie du Fortune 1000 codent avec l’IA

Ce que Google, Microsoft, JPMorgan, Uber, Airbnb et d’autres rapportent sur le code assisté par l’IA, les agents et l’impact mesuré, en 17 sources, et quoi en retenir.

par Patrick Kamtchueng Kom · Publié

Les grandes entreprises ne se contentent plus « d’utiliser Copilot ». Elles imposent des outils, bâtissent les leurs, font rouler des agents qui ouvrent des milliers de pull requests par semaine et en parlent lors de leurs appels aux investisseurs. Elles frappent aussi les mêmes murs que tout le monde : confiance, qualité, mesure. Juste à plus grande échelle.

Ce rapport rassemble ce que les grandes organisations d’ingénierie ont dit publiquement : blogues techniques, déclarations de dirigeants et grands sondages. Chaque chiffre renvoie à une source que j’ai lue, listée en bas de page. Les chiffres d’entreprise sont autodéclarés et rarement définis de la même façon : prenez-les comme des signaux, pas comme des étalons.

Constats clés

Utilisent l’IA au travail [2]Utilisent ou prévoient utiliser l’IA [1]Disent que l’IA a accru leur productivité [2]Voient un effet positif sur la qualité [2]Dévs professionnels, usage quotidien [1]Se méfient de l’exactitude de l’IA [1]Peu ou pas confiance dans le code IA [2]Utilisent des agents chaque jour [1]90 %84 %80 %+59 %51 %46 %30 %14 %0 %50 %100 %
Portrait des sondages, 2025. Barres bleues : adoption et perception. Barres grises : confiance et usage des agents. Sources : DORA 2025 [2], Stack Overflow 2025 [1].
  • L’adoption est quasi universelle, la confiance, pas du tout. Le sondage DORA 2025, mené auprès de près de 5 000 professionnels, montre que 90 % utilisent l’IA au travail, environ deux heures par jour en médiane [2][3]. Chez Stack Overflow, plus de développeurs se méfient de l’exactitude de l’IA (46 %) qu’ils ne lui font confiance (33 %) [1].
  • La part de code écrit par l’IA est devenue un argument de PDG. Satya Nadella l’estimait à 20 à 30 % du code des dépôts de Microsoft en avril 2025 [6]. Un an plus tard, Sundar Pichai affirmait que 75 % du nouveau code chez Google est généré par l’IA et approuvé par des ingénieurs, contre 50 % l’automne précédent [5].
  • Les gains les plus nets viennent de gros chantiers plates mais bien testés. Airbnb a migré environ 3 500 fichiers de tests en six semaines au lieu d’un an et demi estimé [10]. Amazon rapporte plus de 4 500 années-développeur économisées sur des mises à niveau Java [11].
  • Les agents sont en production, derrière une revue humaine. Stripe dit que ses agents maison produisent plus de 1 000 pull requests fusionnées par semaine, toutes revues par une personne [14]. Goldman Sachs pilote un agent de programmation autonome aux côtés de ses 12 000 développeurs, sous supervision humaine [8].
  • Vitesse et stabilité bougent ensemble, pas toujours dans le bon sens. DORA associe une adoption plus forte de l’IA à la fois à plus de débit de livraison et à plus d’instabilité [4].

🃏 Mythe ou réalité? Retournez chaque carte

Touchez une carte pour la retourner

Comment l’adoption se fait réellement

Les récits publics montrent trois modèles récurrents. Ils ne s’excluent pas : la plupart des grandes organisations font les trois en même temps.

1. Acheter et imposer. Coinbase a fourni à tous ses ingénieurs des licences entreprise GitHub Copilot et Cursor, avec une semaine pour s’inscrire. Selon le PDG Brian Armstrong, certains de ceux qui ne l’ont pas fait ont été congédiés. Il admet toutefois une approche « musclée », suivie de séances mensuelles où les équipes partagent leurs usages de l’IA [9]. Une obligation accélère l’adoption, pas la compétence.

2. Bâtir à l’interne. JPMorgan a développé son propre assistant de programmation; sa DPI Lori Beer affirme qu’il a augmenté la productivité de 10 à 20 % pour des dizaines de milliers d’ingénieurs [7]. Morgan Stanley a créé DevGen.AI sur des modèles d’OpenAI, parce que les outils commerciaux géraient mal ses langages patrimoniaux. L’outil a passé en revue 9 millions de lignes de code ancien et fait économiser environ 280 000 heures en traduisant ce code en spécifications en langage clair, que les développeurs réécrivent ensuite [12].

3. La plateforme d’abord, les agents ensuite. Les agents de Stripe tournent sur les mêmes « devboxes » isolées que les humains, avec les mêmes tests et fichiers de règles [14]. Les données de DORA vont dans le même sens : 90 % des organisations ont au moins une plateforme interne, et sa qualité est liée à la valeur tirée de l’IA [3].

  1. 1

    Semaines 1–4

    Projet pilote avec des volontaires

    Une ou deux équipes curieuses, des licences entreprise, des règles écrites sur les données. Prenez une mesure de départ : temps de cycle, taux d’échec des changements, charge de revue.

  2. 2

    Mois 2–3

    Déploiement équipe par équipe

    Élargissez une équipe à la fois, avec une démo et un fichier de règles ou de prompts partagé. Les séances mensuelles de Coinbase sont un modèle peu coûteux [9].

  3. 3

    Mois 3–6

    Viser un gros chantier plate

    Choisissez une migration ou une mise à niveau avec des tests réussite/échec clairs. C’est là qu’Airbnb, Amazon et Morgan Stanley ont vu leurs plus gros gains [10][11][12].

  4. 4

    Mois 6–9

    Ajouter revue IA et agents, avec barrières

    L’IA comme second réviseur, les agents dans des bacs à sable, une approbation humaine à chaque fusion [13][14].

  5. 5

    En continu

    Mesurer et ajuster

    Suivez la stabilité à côté du débit, ainsi que les taux d’acceptation et de rejet des commentaires de l’IA [4][13].

Le développement assisté par l’IA en pratique

Quatre usages reviennent sans cesse. Ils sont très inégaux quant à la facilité de vérifier le résultat.

🧭 Ce que les grandes équipes ont réellement fait

8 affichés · 0 / 8 terminé

  • Airbnb : migration du framework de tests

    [10]Migration

    Environ 3 500 fichiers de tests React migrés d’Enzyme à React Testing Library en six semaines, contre un an et demi estimé à la main. 75 % faits dans les quatre premières heures; 97 % automatisés au final.

    ▸ Détails
    1. Chaque fichier passe par une série d’étapes de validation : tests, lint, vérification des types.
    2. En cas d’échec, on relance avec l’erreur et la dernière version du fichier dans le prompt.
    3. On fournit un contexte riche : tests voisins, lignes directrices de migration, correctifs fréquents.
    4. On ajuste sur 5 à 10 fichiers témoins, puis on relance tout le lot.
  • Amazon : mises à niveau Java à grande échelle

    [11]Migration

    Amazon Q Developer a fait passer des dizaines de milliers d’applications en production de Java 8 ou 11 à Java 17. Amazon estime plus de 4 500 années-développeur économisées et 260 millions de dollars d’économies annuelles.

  • Morgan Stanley : du code ancien aux spécifications

    [12]Migration · Bâti à l’interne

    Un outil maison a traduit 9 millions de lignes de code patrimonial en spécifications en langage clair pour 15 000 développeurs, soit environ 280 000 heures économisées. Il explique le vieux code; les humains écrivent encore le nouveau.

  • Uber : revue de code par l’IA sur chaque diff

    [13]Revue de code

    uReview analyse plus de 90 % des quelque 65 000 diffs hebdomadaires, en 4 minutes en médiane. Les ingénieurs jugent 75 % de ses commentaires utiles et donnent suite à 65 % d’entre eux.

  • JPMorgan : assistant de programmation maison

    [7]Assistant · Bâti à l’interne

    Un assistant développé par la banque a amélioré l’efficacité de 10 à 20 % pour des dizaines de milliers d’ingénieurs, selon sa DPI.

  • Stripe : agents de programmation « one-shot »

    [14]Agents

    Les ingénieurs lancent des agents depuis Slack, une CLI ou des outils internes. Plus de 1 000 PR écrites par des agents sont fusionnées chaque semaine après revue humaine. Stripe est privée, donc absente du classement Fortune, mais c’est l’exemple public le plus détaillé.

  • Goldman Sachs : projet pilote d’agent supervisé

    [8]Agents

    Essai de Devin, de Cognition, aux côtés de 12 000 développeurs. Le chef des technologies Marco Argenti s’attend à ce que les ingénieurs décrivent clairement les problèmes et supervisent le travail des agents.

  • Accenture : essai randomisé de Copilot

    [15]Assistant

    Dans un essai mené en 2024 avec GitHub, les développeurs équipés de Copilot ont ouvert 8,69 % plus de PR, avec un taux de fusion 15 % plus élevé et 84 % plus de builds réussis.

Ce que les cas réussis ont en commun : une définition claire de « terminé » (les tests passent, les types sont valides, le build est vert), des relances automatiques avec rétroaction, et un humain à la barrière. Le billet d’Airbnb est la meilleure recette publique : étapes de validation, boucles de relance et grand contexte battent les prompts astucieux [10].

Les agents en production

Ici, « agent » veut dire un système qui prend une tâche, modifie du code dans plusieurs fichiers, lance les tests et propose une pull request sans qu’on le guide pas à pas. L’adoption est réelle mais étroite : dans le sondage Stack Overflow, environ 14 % des développeurs utilisent des agents chaque jour au travail [1].

  1. TâcheDepuis Slack, un billet ou une alerte de test instable
  2. Bac à sableDevbox isolée, sans accès à la production ni à Internet
  3. Vérifs localesLint et tests ciblés, rapides
  4. CI plafonnéeAu plus deux passes de CI, puis on rend la main
  5. Revue humaineUne personne approuve chaque fusion
Le modèle de garde-fous décrit publiquement par Stripe [14]. Goldman décrit le même principe : des humains supervisent le travail de l’agent [8].

Les garde-fous qui reviennent d’un récit public à l’autre :

  • Isolation. Les agents de Stripe tournent dans des devboxes coupées de la production et d’Internet [14].
  • Contexte et outils circonscrits. Des fichiers de règles appliqués par sous-répertoire et un ensemble choisi d’outils internes exposés par MCP [14].
  • Effort borné. Un plafond ferme de tentatives, pour qu’un agent bloqué rende la main au lieu de brûler du calcul [14].
  • Approbation humaine. Tous les exemples ici gardent une personne sur le bouton de fusion [5][8][14].

Mesurer l’impact

C’est là que les affirmations publiques sont les plus fragiles. Les chiffres d’entreprise n’utilisent pas les mêmes définitions, et la meilleure recherche contrôlée invite à l’humilité.

24 % plus vite20 % plus vite19 % plus lentPrévision avant l’étudeImpression après l’étudeMesuré avec l’IAplus lentaucun effetplus rapide
L’écart de perception. Dans l’essai randomisé de METR en 2025, 16 développeurs open source expérimentés ont traité 246 vraies tâches avec et sans IA [16].

Deux nuances pour rester honnête. METR précise que ce résultat ne se généralise peut-être pas au-delà de développeurs expérimentés travaillant dans des bases de code matures qu’ils connaissent bien [16]. Et en février 2026, METR a revu son protocole : bien des développeurs ne voulaient plus travailler sans IA et évitaient de soumettre les tâches où elle aide le plus, ce qui biaise les résultats vers le ralentissement [17]. La leçon durable n’est donc pas « l’IA ralentit ». C’est que les gains de vitesse autodéclarés ne sont pas fiables, et qu’une impression n’est pas une mesure.

Ce que les entreprises rapportent vraiment, de la preuve la plus faible à la plus solide :

Mesure Exemple Point d’attention
Part du code écrite par l’IA Microsoft 20–30 % [6], Google 75 % [5] Aucune définition commune; ne dit rien de la valeur
Productivité autodéclarée Plus de 80 % des répondants DORA [2] Écart de perception [16]
Estimations d’efficacité JPMorgan 10–20 % [7] Méthodologie rarement publiée
Temps ou coût économisé sur un chantier précis Airbnb [10], Amazon [11], Morgan Stanley [12] Comparé à une estimation, pas à un vrai groupe témoin
Utilité et suivi des commentaires Uber : 75 % utiles, 65 % suivis [13] Mesure l’outil, pas le résultat
Essai contrôlé Accenture [15], METR [16] Populations petites ou particulières

🧠 Vérifiez votre lecture

Pointage: 0 / 5

  1. 1. Quelle combinaison DORA 2025 associe-t-il à une adoption plus forte de l’IA?

  2. 2. Combien de temps a pris la migration de tests d’Airbnb, par rapport à l’estimation manuelle?

  3. 3. Dans l’essai METR de 2025, qu’ont cru les développeurs après avoir utilisé l’IA?

  4. 4. Quelle technique Uber a-t-elle utilisée pour éviter que la revue par l’IA devienne du bruit?

  5. 5. Quel est le garde-fou le plus courant dans les déploiements d’agents publics?

Ce que cela signifie pour votre équipe

Vous n’êtes probablement pas Google. Vous n’avez pas besoin d’une flotte d’agents qui produit 1 000 PR par semaine. Mais la logique derrière les réussites publiques s’applique bien à une équipe de 10 ou de 200 personnes : solidifier les fondations, pointer l’IA vers du travail vérifiable, garder un humain à la barrière et mesurer la stabilité autant que la vitesse. DORA décrit l’IA comme un amplificateur : elle grossit les bonnes comme les mauvaises pratiques [3].

Voici où je pousserais la plupart des équipes, dans l’ordre :

  1. Solidifier les tests et la CI avant d’étendre l’IA. Chaque gros gain ci-dessus reposait sur une définition automatique de « terminé ». Sans elle, l’IA produit simplement plus de code non vérifié, plus vite.
  2. Choisir une migration. Une mise à niveau de framework, une API dépréciée, un changement de bibliothèque de tests. C’est là que le rendement est le plus clair et le risque le mieux contenu.
  3. Imposer l’apprentissage, pas les outils. La leçon de Coinbase : les séances de partage comptent plus que l’échéance [9].
  4. Traiter la charge de revue comme le vrai goulot. Si l’IA double le volume de PR et que les réviseurs restent les mêmes, vous avez déplacé la file d’attente, pas éliminée [4].
  5. Protéger l’apprentissage des juniors. DORA prévient que l’IA peut court-circuiter l’effort formateur qui bâtit l’expertise, et recommande un mentorat actif [4].

📊 Comment votre équipe se compare-t-elle?

  1. 1. La plupart de nos développeurs utilisent un assistant IA chaque semaine, avec des licences et des règles écrites sur les données.

  2. 2. Nos tests et notre CI donnent un verdict fiable en quelques minutes.

  3. 3. Nous avons utilisé l’IA pour au moins une migration ou mise à niveau circonscrite, avec des critères de réussite clairs.

  4. 4. La revue par l’IA ou les agents passent par une approbation humaine, dans des environnements isolés.

  5. 5. Depuis l’adoption de l’IA, nous suivons la stabilité (taux d’échec des changements, retours arrière) à côté du débit.

  6. 6. Nous tenons des séances régulières où chacun partage ses façons de travailler avec l’IA et ce qui a échoué.

Répondez à toutes les questions pour voir votre résultat

✅ Vos 30 prochains jours

0 / 6 complété

Sources

  1. Stack Overflow 2025 Developer Survey: AI
  2. How are developers using AI? Inside Google's 2025 DORA report (Google Blog)
  3. Announcing the 2025 DORA Report (Google Cloud Blog)
  4. Balancing AI tensions: Moving from AI adoption to effective SDLC use (DORA)
  5. Sundar Pichai shares news from Google Cloud Next 2026 (Google Blog)
  6. Microsoft CEO says up to 30% of the company's code was written by AI (TechCrunch)
  7. JPMorgan engineers' efficiency jumps as much as 20% from using coding assistant (Reuters via Yahoo Finance)
  8. Meet Devin the AI Software Engineer, Employee #1 in Goldman Sachs' Hybrid Workforce (IBM Think)
  9. Coinbase CEO explains why he fired engineers who didn't try AI immediately (TechCrunch)
  10. Accelerating Large-Scale Test Migration with LLMs (Airbnb Engineering)
  11. Amazon Q Developer just reached a $260 million dollar milestone (AWS DevOps Blog)
  12. Morgan Stanley created an AI tool to fix the most annoying part of coding (Entrepreneur)
  13. uReview: Scalable, Trustworthy GenAI for Code Review at Uber (Uber Blog)
  14. Minions: Stripe's one-shot, end-to-end coding agents (Stripe Dev Blog)
  15. Research: Quantifying GitHub Copilot's impact in the enterprise with Accenture (GitHub Blog)
  16. Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity (METR)
  17. We are Changing our Developer Productivity Experiment Design (METR)