En décembre 2025, Apple a publié SHARP, un modèle capable de transformer une seule image 2D en scène 3D en moins d’une seconde sur un GPU courant. La démonstration est rapide, mais les reflets, les objets mal placés et les zones invisibles rappellent que la géométrie garde son mot à dire.
Une photo, un SHARP, et hop la profondeur
Le modèle SHARP part d’une contrainte sévère : une seule image. Pas de série de clichés pris sous plusieurs angles, pas de caméra stéréoscopique, pas de scan complet de la pièce. Dans l’étude Sharp Monocular View Synthesis in Less Than a SecondApple décrit sa méthode comme « an approach to photorealistic view synthesis from a single image », soit une synthèse photoréaliste de points de vue à partir d’une image unique.
Le réseau neuronal estime la profondeur de la scène, puis produit une représentation 3D fondée sur des millions d’ellipsoïdes ou de volumes gaussiens. La scène n’est donc pas reconstruite comme un empilement classique de triangles. Elle prend la forme d’un ensemble de petits éléments volumétriques capables de donner une impression de relief quand le point de vue bouge.
Apple indique que SHARP réalise cette opération en moins d’une seconde sur un GPU courant, avec un seul passage direct dans le réseau neuronal. Le modèle a été entraîné sur de grands ensembles de données pour apprendre des régularités de profondeur, comme la position probable du sol, du ciel ou d’un objet devant un autre. Le chiffre qui claque est inférieur à une seconde, pas un score de benchmark mesuré sur un iPhone.
Le GPU met le turbo, l’iPhone reste au banc
SHARP est un modèle de recherche public dont le code est disponible sur GitHub. Cette information le distingue d’une fonction prête à l’emploi dans iOS : un appareil mobile doit composer avec sa mémoire, sa consommation énergétique, son temps de réponse et un éventuel fonctionnement hors ligne.
Apple permet déjà de convertir des photos 2D en scènes donnant une impression de profondeur avec Spatial Scenes dans iOS 26. Le rapprochement avec SHARP est tentant, mais le modèle de recherche ne remplace pas directement cette fonction et rien ne permet d’affirmer qu’il sera intégré tel quel à une prochaine mise à jour. Ce serait un raccourci un peu trop facile, même pour une marque qui sait faire passer trois mots techniques pour une nouvelle catégorie de produit.
Une conversion rapide peut alimenter une expérience de réalité mixte ou un aperçu d’objet, à condition que le déplacement du point de vue reste cohérent. Une scène qui réagit mal dès que l’on bouge la caméra, c’est du flan en relief.
Quand la fleur prend le bee-bop

Les exemples d’échec présentés dans la recherche sont très concrets. SHARP peut placer une abeille derrière une fleur alors qu’elle se trouve au-dessus, ou interpréter le ciel comme une surface courbe située à proximité. Les reflets complexes lui posent aussi problème : une vitre, un miroir ou une carrosserie mélangent profondeur apparente et lumière réfléchie.
Le modèle ne complète pas non plus les zones invisibles. Il reconstruit ce que l’image montre, mais ne fabrique pas une pièce entière derrière un mur ni l’arrière d’un objet masqué. Si l’utilisateur décale son point de vue, certaines parties peuvent donc rester absentes ou produire une géométrie approximative. La scène 3D est une relecture de l’image, pas un scan complet du monde.
La 3D n’est pas née dans une keynote
Une revue publiée en 2021 dans IEEE Transactions on Pattern Analysis and Machine Intelligence décrit la reconstruction 3D à partir d’images comme un problème ancien et mal posé. Elle passe en revue les méthodes qui estiment la forme d’objets génériques à partir d’une ou plusieurs images RGB, ainsi que différentes représentations, architectures de réseaux et méthodes d’entraînement.
SHARP s’inscrit dans cette famille de travaux, avec une priorité nette donnée à la vitesse et à la synthèse d’un point de vue depuis une seule photo. La méthode peut produire un relief plausible très vite, mais elle reste dépendante de ce que la prise de vue révèle et de ce que le réseau déduit. Rapide, oui. Complet, non.
Sources et références scientifiques
- Marko Zivkovic. Apple's AI & ML research papers show instant 3D image conversion, more. 2025.
- Han XF, Laga H, Bennamoun M.. Image-Based 3D Object Reconstruction: State-of-the-Art and Trends in the Deep Learning Era.. IEEE transactions on pattern analysis and machine intelligence. 2021. DOI: 10.1109/tpami.2019.2954885 · PMID: 31751229. (résumé scientifique structuré; texte intégral non fourni)
- Fan B, Kong Q, Wang X, Wang Z, Xiang S, Pan C, Fua P.. A Performance Evaluation of Local Features for Image-Based 3D Reconstruction.. IEEE transactions on image processing : a publication of the IEEE Signal Processing Society. 2019. DOI: 10.1109/tip.2019.2909640 · PMID: 30969920. (résumé scientifique structuré; texte intégral non fourni)
- Apple's AI & ML research papers show instant 3D image conversion, more, AppleInsider Forums.
- Marko Zivkovic. Apple's AI & ML research papers show instant 3D image conversion, more – NewsBreak. 2025.






