2 Une Inégalité de convexité: l’Inégalité de Jensen

La convexité (ou la concavité) est souvent utilisée pour établir des inégalités.22 2 Cette partie reprend le cours de 2018-2019 de T. Blossier, M. Carrizosa et J. Melleray.

Voyons maintenant l’inégalité de convexité la plus importante de notre cours.

★ Théorème 5.5 (Inégalité de Jensen).

Soit (X,𝒜,μ) un espace de probabilité, g une fonction μ-intégrable à valeurs dans un intervalle I, et φ:I→ℝ une fonction convexe. Alors on a

φ⁢(∫Xg⁢𝑑μ)≤∫Xφ∘g⁢𝑑μ

(l’intégrale de droite peut être égale à +∞!).

Démonstration : 

D’abord, par le théorème 3.9, φ est dérivable à droite et à gauche, donc continue sur l’intérieur de I, donc borélienne sur I (exo) donc la composée φ∘g est bien mesurable. Posons m=∫Xg⁢𝑑μ. Notons que m∈I. En effet I est définie par une ou deux inégalités, I=I1∩I2 avec (I1={x:x≥a} ou I1={x:x>a} ou I1=ℝ) et de même (I2={x:x≤b} ou I2={x:x<b} ou I2=ℝ). Expliquons d’abord que si g est à valeur dans I1={x:x≥a}, alors comme l’intégrale préserve les inégalités larges ∫Xg⁢𝑑μ≥∫Xa⁢𝑑μ=a car μ⁢(X)=1 et donc m∈I1. De même si I1={x:x>a} si on n’avait pas ∫Xg⁢𝑑μ>a, on aurait donc ∫Xg⁢𝑑μ=a=∫Xa⁢𝑑μ donc ∫X(g−a)⁢𝑑μ=0 mais alors g−a serait nulle μ-presque partout, donc {x∈X:g⁢(x)>a}=X serait de mesure nulle, contredisant l’hypothèse que X est un espace de probabilité. On conclut donc aussi dans ce cas ∫Xg⁢𝑑μ∈I1. On raisonne pareil pour I2 (ou on applique le premier cas à −g pour changer le sens des inégalités).

Maintenant qu’on a vu que m∈I, on distingue 3 cas. Si jamais m est le minimum de I (s’il existe!) alors on a ∫X(g−m)⁢𝑑μ=0 et g−m≥0, donc g−m est nulle presque partout, par conséquent on a

∫Xφ∘g⁢𝑑μ=∫Xφ⁢(m)⁢𝑑μ=φ⁢(m)=φ⁢(∫Xg⁢𝑑μ).

On traite de même le cas où m est le maximum de I; finalement, le cas qui nous reste est celui où m appartient à l’intérieur de I.

Alors, on sait que φg′⁢(m) existe et en posant α=φg′⁢(m), le théorème 3.9 donne que

∀t∈I⁢φ⁢(t)−φ⁢(m)≥α⁢(t−m).

En particulier, pour tout x∈X on a φ⁢(g⁢(x))≥φ⁢(m)+α⁢(g⁢(x)−m). Comme g est intégrable et les fonctions constantes sont intégrables (car μ est finie), donc la borne inférieure est intégrable, et on en déduit que la partie négative de φ∘g est d’intégrale finie; et en intégrant cette inégalité, on obtient aussi que

∫Xφ∘g⁢𝑑μ≥∫Xφ⁢(m)⁢𝑑μ+α⁢∫X(g−m)⁢𝑑μ=φ⁢(m)+α⁢(∫Xg⁢𝑑μ−m)=φ⁢(m).

□

Le corollaire suivant est un cas (très) particulier de l’inégalité de Jensen, qui peut se montrer élémentairement, sans théorie de la mesure.

Corollaire 5.6.

Soit I un intervalle de ℝ, α1,…,αn des réels positifs tels que ∑i=1nαi=1, et φ une fonction convexe sur I. Alors, pour tout x1,…,xn∈I on a

φ⁢(∑i=1nαi⁢xi)≤∑i=1nαi⁢φ⁢(xi).
Démonstration : 

On fixe x1,…,xn∈I et on considère l’espace mesuré d’ensemble sous-jacent X={x1,…,xn}, où toutes les parties sont mesurables et μ=∑i=1nαi⁢δxi, où δxi désigne la mesure de Dirac en xi. Alors μ est une mesure de probabilité; de plus pour toute fonction g:X→ℝ on a

∫Xg⁢𝑑μ=∑i=1nαi⁢g⁢(xi).

En considérant pour g la fonction identité, on a donc ∫Xφ∘g⁢𝑑μ=∑i=1nαi⁢φ⁢(xi), et ∫Xg⁢𝑑μ=∑i=1nαi⁢xi. L’inégalité de Jensen nous donne donc comme attendu

φ⁢(∑i=1nαi⁢xi)≤∑i=1nαi⁢φ⁢(xi).

□

Remarque 5.1.

Dans le corollaire ci-dessus, le cas n=2 correspond exactement à la définition de la convexité. En particulier, une application φ qui satisfait l’inégalité de Jensen pour toute fonction intégrable sur un espace de probabilité, est nécessairement convexe.