La performance des contrats axés sur les résultats dans l'externalisation publique : une méta-analyse de régression

Chercheur principal : Omar Barroso Khodr

Auteurs : Bel, Espaillat et Esteve (2025)

Titre original : La performance des contrats de performance dans l’externalisation publique : une méta-analyse de régression

Lieu de l'intervention : États-Unis et Royaume-Uni.

Taille de l'échantillon : 740 observations

Variable principale d'intérêt :

Type d'intervention : Optimisation des politiques publiques

Méthodologie : méta-analyse et méta-régression.

Résumé

Le contrat de performance est présenté comme un modèle permettant d'améliorer les résultats, d'accroître la qualité, de réduire les coûts et de renforcer la responsabilisation. Il est devenu une norme dans les marchés publics à l'échelle mondiale et un élément essentiel des modèles de rémunération au résultat les plus récents . Toutefois, les évaluations universitaires sur le sujet restent éparses et manquent souvent de fondements théoriques solides.

Cette étude présente une méta-analyse de 740 observations issues de 38 études, couvrant dix domaines de services, afin d'évaluer la performance réelle des marchés publics. S'appuyant sur la théorie de l'agence, la théorie des contrats incomplets et la notion de fixation d'objectifs, elle examine les facteurs influençant la performance de ce type de contrat. En intégrant ces perspectives dans un cadre empirique unique, l'article propose une vérification systématique des hypothèses fondamentales relatives à l'alignement des incitations, à l'incomplétude des contrats et à la fixation d'objectifs dans les marchés publics.

Les résultats indiquent que les contrats axés sur les résultats finaux sont plus performants que ceux axés sur les processus ou produits intermédiaires ( extrants ). Cette observation apporte une preuve quantitative qui corrobore la thèse de la théorie des contrats incomplets, selon laquelle la performance dépend de la contractualisation des résultats. De plus, elle enrichit la logique principal-agent en démontrant quand et pourquoi les incitations échouent dans des contextes publics multidimensionnels.

Bien que le contexte soit important, des facteurs tels que le contrôle résiduel, la collaboration et les objectifs partagés s'avèrent essentiels au succès de la gestion participative des contrats. Ainsi, cette étude apporte une contribution théorique en reliant les théories économiques et comportementales des contrats et en étayant empiriquement ses prédictions par des données issues du secteur public.

  1. Problème de politique

Selon les auteurs, les contrats de performance se sont multipliés dans le secteur public en réponse aux contraintes budgétaires et à l'exigence de justification de l'utilisation des ressources publiques, mais sans une vision globale de leurs facteurs de réussite. Cette étude comble cette lacune grâce à une méta-régression, à l'intersection des théories principal-agent, du contrat incomplet et de la fixation d'objectifs, et fait progresser le débat théorique en examinant l'alignement des incitations, en évaluant empiriquement la contractualisation et en intégrant une perspective comportementale à la théorie des contrats.

Les résultats indiquent que l'effet réel du PBC sur la performance est positif, mais faible et non statistiquement significatif, ce qui est fréquent dans les interventions politiques soumises à des facteurs externes et à des différences contextuelles. Les analyses montrent que les indicateurs axés sur le processus et le produit sont moins performants que ceux basés sur les résultats et l'impact, tandis que les services sociaux apportent un soutien moins important à l'hypothèse d'une moindre efficacité, suggérant que les gouvernements et les prestataires surmontent les difficultés de mesure et de suivi pour obtenir des résultats plus significatifs. Les autres caractéristiques du PBC n'ont pas montré de signification statistique.

Ainsi, les auteurs soulignent l'absence d'efforts empiriques systématiques antérieurs visant à synthétiser les données probantes sur le succès des partenariats public-privé (PPP) dans le secteur public. Les études existantes, agnostiques du secteur, adoptent une perspective commerciale et reposent principalement sur des études conceptuelles et qualitatives, à l'exception du secteur de la santé, dont les méta-analyses ne font pas de distinction entre dispositifs publics et privés. Les marchés publics diffèrent fondamentalement des marchés privés par leur structure, leur complexité, leur composition (avec des relations triadiques communes) et leur soumission aux exigences et au contrôle politiques, ce qui justifie une analyse spécifique prenant en compte leurs particularités institutionnelles et les défis supplémentaires liés à la responsabilité et à la transparence.

  1. Contexte de mise en œuvre des politiques

Selon les auteurs, le modèle de paiement à l'utilisation (PBC) repose sur l'alignement des incitations sur des résultats mesurables, partant du principe que cet alignement améliore la performance. Contrairement aux contrats traditionnels, axés sur les intrants et les activités, le PBC privilégie les produits et les résultats, offrant ainsi aux prestataires une plus grande flexibilité pour innover et liant les incitations aux objectifs des politiques publiques. En liant le paiement à la performance, il renforce la responsabilisation, stimule l'efficience et vise un meilleur rapport coût-bénéfice.

Dans ce contexte, le PBC repose sur trois piliers théoriques. S’appuyant sur la théorie de l’agence, il s’attaque à l’asymétrie d’information et à l’aléa moral en liant les récompenses financières à la réalisation d’objectifs clairs, alignant ainsi les efforts des prestataires de services sur les objectifs du client.

Les auteurs soulignent que, selon la théorie des contrats incomplets, les contrats ne peuvent prévoir toutes les éventualités, ce qui rend essentiels les droits de contrôle résiduels, qui demeurent entre les mains du propriétaire de l'actif. Cela implique que la propriété privée est associée à des comportements de réduction des coûts plus marqués qu'à des comportements d'amélioration de la qualité, un défi auquel le contrôle privé répond en équilibrant le compromis entre coût et qualité. Selon la théorie de la fixation des objectifs, des objectifs clairs et ambitieux, renforcés par un retour d'information, améliorent la performance.

Ainsi, la mise en œuvre du PBC se heurte à des difficultés pour définir et mesurer la performance. Les indicateurs de processus et de produit sont plus faciles à mesurer, mais se concentrent sur les activités à court terme et négligent les résultats transformationnels, créant un « paradoxe de la performance ». Les mesures axées sur les résultats permettent l’innovation, mais sont difficiles à définir, à suivre et à contrôler, avec le risque de sanctions injustes dues à des facteurs indépendants de la volonté des prestataires de services.

Cependant, les services sociaux présentent des défis uniques. Ils impliquent des besoins dynamiques et multiformes, difficiles à appréhender par les mesures conventionnelles. La littérature souligne que les systèmes standardisés s'appuient souvent sur des indicateurs simplistes qui ne tiennent pas compte de la complexité organisationnelle, du jugement professionnel, de l'équité et de la fragmentation intergouvernementale. Les résultats intangibles, les impacts à long terme et la dépendance au contexte compromettent la validité de l'évaluation basée sur la performance dans ces secteurs.

Ainsi, la concurrence sur le marché constitue une incitation implicite. Dans des environnements plus concurrentiels, les gestionnaires sont plus sensibles aux incitations, et la concurrence réduit l'asymétrie d'information. Les décisions de renouvellement de contrat sont influencées par les performances passées. Cependant, des niveaux de concurrence optimaux sont rarement observés sur les marchés publics. Dans les secteurs essentiels, la concurrence peut déstabiliser les services, tandis que sur les marchés à forte spécificité d'actifs, une concurrence réduite peut améliorer les performances grâce à la confiance et à un engagement à long terme.

Prises ensemble, les théories de l'agence et du contrat incomplet expliquent que le PBC favorise la performance lorsque les résultats sont observables et vérifiables, mais échoue lorsque la qualité est multidimensionnelle, ambiguë ou politiquement contestée, risquant d'encourager une focalisation uniquement sur le mesurable au détriment du pertinent.

En résumé, l’efficacité du PBC dépend du type de mesure adoptée (processus/produit versus résultat/impact), du secteur d’activité (services à la personne versus services techniques), du niveau de concurrence et de la capacité à équilibrer les incitations extrinsèques et intrinsèques, en particulier dans les secteurs axés sur une mission, où des incitations financières excessives peuvent nuire à la motivation intrinsèque des professionnels.

  1. Détails de l'évaluation

D’après les auteurs, la constitution du méta-échantillon a débuté par une analyse des principales revues dans les domaines de l’administration publique, de l’économie, des transports et des services sociaux. Les mots-clés extraits de ces études ont ensuite été appliqués à de multiples bases de données, dont Web of Science, Scopus, EBSCO, JSTOR, PROQUEST, ETHOS (pour les thèses de doctorat) et Google Scholar.

Ainsi, les études publiées jusqu'en 2024 ont été incluses, avec une vérification finale en janvier 2025. La recherche a également porté sur les références d'articles sélectionnés, les revues pertinentes sur la gestion comportementale positive (GCP) et les sites web d'institutions gouvernementales et de groupes de réflexion , tels que l'Urban Institute, le Harvard Government Performance Lab, le Government Outcomes Lab, le gouvernement britannique et l'OBM américain. La démarche a respecté les recommandations PRISMA et les bonnes pratiques préconisées pour les méta-analyses.

Ensuite, quatre critères ont été établis pour l'inclusion dans l'échantillon : (1) la nature empirique, avec des méthodes de régression multivariée ; (2) la variable dépendante alignée sur des mesures de performance explicitement incitatives ; (3) la présence d'un contrefactuel, évaluant l'effet du PBC par rapport à un modèle alternatif sans incitations à la performance ; et (4) le contexte public, le PBC étant principalement financé par des ressources publiques et géré contractuellement par des entités publiques.

Selon les auteurs, les obligations à impact social (OIS) ont été exclues car elles impliquent de multiples partenaires et des mécanismes financiers innovants susceptibles de fausser les effets de la communication publique, outre le manque d'études empiriques évaluées par les pairs. Les relations publiques entre elles ont également été écartées, car elles relèvent d'une coopération intergouvernementale et non de contrats d'externalisation auprès de fournisseurs privés.

Les auteurs soulignent que les initiatives individuelles, assorties d'incitations directes pour les employés ou les clients, ont été exclues car elles fonctionnent selon des dynamiques motivationnelles distinctes des dynamiques organisationnelles. Les secteurs de l'éducation et de la santé hospitalière ont été exclus : le premier car il adopte des modèles de financement axés sur la performance et centrés sur les individus ou les transferts interpublics ; le second car une méta-analyse spécifique existe déjà dans la littérature. Les études présentant des relations empiriques distinctes, telles que les jeux de hasard , les biais de sélection ou l'équité, ont également été exclues car elles analysent les conséquences imprévues et non l'effet direct de la rémunération au rendement sur la performance contractuelle.

Au final, l'échantillon comprenait 38 études, dont sept n'avaient pas fait l'objet d'une évaluation par les pairs, soit un total de 740 observations pour l'analyse des effets globaux. Une observation a été exclue de la méta-régression en raison d'un manque d'informations. Les chercheurs ont contacté les auteurs de six études afin d'obtenir des données supplémentaires ou des informations non publiées. Des analyses de sensibilité et des modèles de régression additionnels ont été réalisés pour toutes les études.

  1. Méthode

La méta-analyse a intégré 38 études empiriques, totalisant 740 observations. Des critères d'exclusion rigoureux ont été appliqués : les obligations à impact social (OIS), les relations publiques, les initiatives individuelles de partenariat public-privé (PPP), ainsi que les secteurs de l'éducation et de la santé hospitalière ont été écartés – ce dernier faisant déjà l'objet d'une méta-analyse spécifique. En revanche, les services des établissements de soins de longue durée pour personnes âgées ont été conservés, car ils relèvent de la protection sociale et n'avaient pas été étudiés auparavant.

L'échantillon final comprenait sept études non évaluées par les pairs. Des analyses de sensibilité et des régressions supplémentaires ont été réalisées, et les auteurs de six études ont été contactés pour obtenir des données complémentaires. Une observation a été exclue de la méta-régression en raison d'un manque d'informations.

L'effet a été mesuré par le coefficient de corrélation partielle, calculé à partir des statistiques t des études originales, après conversion des rapports de cotes en corrélations de Pearson. Tous les effets ont été transformés en scores Z de Fisher afin de corriger les biais. Dans une étude, la méthode de la borne inférieure a été utilisée pour estimer l'effet.

Les modérateurs de contrôle de la qualité et de la conception ont été inclus : facteur d’impact de la revue, taille de l’échantillon, présence de stratégies de correction de l’endogénéité (telles que la méthode des doubles différences, l’appariement et les effets fixes) et type de modèle statistique (continu ou dichotomique). Les variables relatives au pays ont été exclues en raison de la multicolinéarité.

Le modèle de méta-régression a régressé le score Z en fonction du type de mesure, de la nature du service, de la concurrence, du modèle de prestation, du facteur d'impact, de la taille de l'échantillon, du contrôle de l'endogénéité et du modèle statistique.

Pour évaluer le biais de publication, la littérature grise a été prise en compte. Le graphique en entonnoir a montré une symétrie, et les tests d'Egger (p = 0,132) et de Begg (p = 0,153) ont confirmé l'absence de biais, y compris dans le sous-échantillon d'études évaluées par les pairs.

  1. Principaux résultats

D'après les résultats de la méta-analyse, le recrutement basé sur la performance (RBP), considéré isolément, n'a pas d'effet significatif sur la performance (coefficient = 0,008 ; p = 0,303). Ce résultat indique que la simple adoption de ce modèle ne garantit pas de meilleurs résultats et qu'une analyse des facteurs contextuels et méthodologiques est nécessaire pour comprendre ses conditions d'efficacité.

Selon les auteurs, lorsque ces facteurs sont contrôlés, l'effet moyen devient positif et statistiquement significatif (coefficient = 0,119 ; p < 0,01), démontrant que le succès de la gestion axée sur les résultats (GAR) dépend de variables spécifiques. Parmi les modérateurs, le type de métrique utilisé se distingue : les contrats axés sur les processus présentent une corrélation négative et significative avec la performance, comparativement aux métriques basées sur les résultats finaux ( coefficient = -0,038 ; p < 0,05). Ce résultat corrobore l'hypothèse selon laquelle une approche centrée sur les résultats favorise l'innovation et l'autonomie des prestataires de services.

Dans ce contexte, concernant les services sociaux, un effet négatif à la limite de la significativité a été observé dans le modèle GEE (coefficient = -0,098 ; p < 0,10), suggérant des difficultés spécifiques de mesure et d’attribution de la performance dans ce secteur. Cependant, la fragilité statistique de ce résultat invite à la prudence dans son interprétation.

Les autres variables analysées — concurrence sur le marché, structure organisationnelle (publique, privée ou mixte), utilisation de stratégies d'endogénéité, facteur d'impact de la revue, taille de l'échantillon et type de modèle statistique (continu ou dichotomique) — n'ont pas produit d'effets significatifs sur la performance du PBC.

En résumé, les résultats indiquent que l'efficacité du PBC n'est pas automatique, mais dépend fondamentalement de la conception contractuelle, notamment du choix des indicateurs orientés vers les résultats finaux, tandis que des facteurs tels que la qualité méthodologique des études et les caractéristiques organisationnelles ne se sont pas révélés décisifs.

  1. Leçons de politique publique

D’après les auteurs, la méta-analyse démontre que le recrutement basé sur la performance (RBP), pris isolément, n’a pas d’effet significatif sur la performance (coefficient = 0,008 ; p = 0,303). Les gouvernements ne devraient pas l’adopter comme une réforme générique sans évaluer le contexte.

Ainsi, le succès du PBC dépend de la conception des indicateurs : les contrats axés sur les résultats finaux ( impacts ) sont plus performants que ceux basés sur les processus ou les produits intermédiaires ( extrants ) (coefficient = -0,038 ; p < 0,05). Il est recommandé de privilégier les indicateurs de valeur sociale effective, d’investir dans le suivi des résultats et d’associer les prestataires et les bénéficiaires à la définition des indicateurs.

Dans ce contexte, les services à la personne (aide sociale, garde d'enfants, réadaptation) présentent des difficultés de mise en œuvre plus importantes (coefficient = -0,098 ; p < 0,10), nécessitant des modèles hybrides qui combinent des incitations financières avec des mécanismes relationnels et des capacités de suivi spécifiques.

Il convient de noter que la concurrence sur le marché (p = 0,169) et la structure organisationnelle du prestataire (p = 0,531) n'ont pas d'influence significative sur la performance. Des facteurs tels que la conception des incitations, le contrôle des variables de performance, la flexibilité contractuelle et la confiance mutuelle sont plus pertinents. En ce sens, des contrats incomplets ne nuisent pas à la performance lorsque les objectifs sont clairs et partagés, et peuvent même favoriser l'innovation et l'adaptation. Il est recommandé de trouver un équilibre entre spécification et flexibilité et d'investir dans une gouvernance collaborative.

Par conséquent, le contrôle par la performance (CPP) peut entraîner une manipulation des indicateurs ( biais ) et une sélection des bénéficiaires ( écrémage ) lorsque les incitations sont fortes et le contrôle insuffisant. Des systèmes de vérification robustes, des incitations dissuadant l'opportunisme et des mécanismes de sanction clairs sont essentiels. Des études contrôlant l'endogénéité suggèrent que les recherches moins rigoureuses surestiment l'impact du CPP. Des évaluations contrefactuelles robustes et des évaluations indépendantes sont nécessaires avant d'étendre les programmes.

En définitive, la contractualisation basée sur la performance (CBP) n'est pas intrinsèquement supérieure aux autres formes de contrats. Son succès repose sur la conception des incitations, le choix des indicateurs, les capacités institutionnelles, la complexité des services et la gouvernance relationnelle. Les politiques fondées sur des données probantes exigent une conception rigoureuse, un suivi continu, une évaluation rigoureuse et une capacité d'adaptation. La CBP est un outil précieux, mais non une solution miracle.