Search engine for discovering works of Art, research articles, and books related to Art and Culture
ShareThis
Javascript must be enabled to continue!

3D hand-object reconstruction from RGB images

View through CrossRef
Reconstruction 3D main-objet à partir d'images RGB La reconstruction 3D main-objet est un problème complexe en vision par ordinateur, notamment en raison des variations dans les catégories d'objets, les formes, les matériaux, et les textures, ainsi que l'occlusion mutuelle entre la main et l'objet, entraînant souvent des vues partielles. Pourtant, l'estimation précise de formes 3D sans modèle prédéfini est essentielle pour des applications en réalité augmentée (AR) / réalité virtuelle (VR) et des tâches robotiques comme l'interaction homme-robot. Les méthodes actuelles, basées sur des images uniques ou des vidéos monoculaires, montrent des résultats prometteurs, mais sont limitées par l'hypothèse de classes d'objets connues, la dépendance à des techniques de détection de points clés et de structure-from-motion. Elles échouent souvent face à des objets mal texturés ou des occlusions main-objet.Cette thèse aborde le défi de la reconstruction 3D détaillée et conjointe main-objet à partir de vidéos monoculaires, indépendamment des objets. Notre travail apporte trois contributions principales. Premièrement, nous présentons un pipeline en deux étapes pour la reconstruction conjointe main-objet. Ce pipeline, testé sur le jeu de données vidéo SHOWMe, propose des transformations et une reconstruction des formes main-objet. Bien qu'efficace, il présente des difficultés avec les objets petits ou uniformément texturés. Pour surmonter cela, notre deuxième contribution introduit un cadre robuste d'estimation de transformations main-objet pour les scénarios avec peu de données. Ce cadre comprend un réseau d'estimation de poses relatives, suivi d'une optimisation des transformations globales main-objet sur un graphe de scène. Intégré à notre pipeline initial, il démontre sa robustesse face à des objets variés, mais nécessite un ajustement fin pour différents jeux de données.Enfin, nous proposons une méthode sans détecteur de points clés pour l'estimation des transformations main-objet, indépendante de l'appareil de capture et capable de généraliser sans ajustement préalable. Intégrée à notre pipeline, elle est testée avec succès sur les jeux de données SHOWMe et HO3D, confirmant ses performances et sa capacité de généralisation.
Agence Bibliographique de l'Enseignement Supérieur
Title: 3D hand-object reconstruction from RGB images
Description:
Reconstruction 3D main-objet à partir d'images RGB La reconstruction 3D main-objet est un problème complexe en vision par ordinateur, notamment en raison des variations dans les catégories d'objets, les formes, les matériaux, et les textures, ainsi que l'occlusion mutuelle entre la main et l'objet, entraînant souvent des vues partielles.
Pourtant, l'estimation précise de formes 3D sans modèle prédéfini est essentielle pour des applications en réalité augmentée (AR) / réalité virtuelle (VR) et des tâches robotiques comme l'interaction homme-robot.
Les méthodes actuelles, basées sur des images uniques ou des vidéos monoculaires, montrent des résultats prometteurs, mais sont limitées par l'hypothèse de classes d'objets connues, la dépendance à des techniques de détection de points clés et de structure-from-motion.
Elles échouent souvent face à des objets mal texturés ou des occlusions main-objet.
Cette thèse aborde le défi de la reconstruction 3D détaillée et conjointe main-objet à partir de vidéos monoculaires, indépendamment des objets.
Notre travail apporte trois contributions principales.
Premièrement, nous présentons un pipeline en deux étapes pour la reconstruction conjointe main-objet.
Ce pipeline, testé sur le jeu de données vidéo SHOWMe, propose des transformations et une reconstruction des formes main-objet.
Bien qu'efficace, il présente des difficultés avec les objets petits ou uniformément texturés.
Pour surmonter cela, notre deuxième contribution introduit un cadre robuste d'estimation de transformations main-objet pour les scénarios avec peu de données.
Ce cadre comprend un réseau d'estimation de poses relatives, suivi d'une optimisation des transformations globales main-objet sur un graphe de scène.
Intégré à notre pipeline initial, il démontre sa robustesse face à des objets variés, mais nécessite un ajustement fin pour différents jeux de données.
Enfin, nous proposons une méthode sans détecteur de points clés pour l'estimation des transformations main-objet, indépendante de l'appareil de capture et capable de généraliser sans ajustement préalable.
Intégrée à notre pipeline, elle est testée avec succès sur les jeux de données SHOWMe et HO3D, confirmant ses performances et sa capacité de généralisation.

Related Results

RGB versus Early-Fusion RGB-D Glass Segmentation
RGB versus Early-Fusion RGB-D Glass Segmentation
Transparent glass is a persistent perception hazard for indoor mobile robots: RGB boundaries can be visually ambiguous, while commodity depth sensors often return missing or distor...
RGB-D egocentric segmentation of human bodies for XR applications
RGB-D egocentric segmentation of human bodies for XR applications
Introduction Video-based self-avatars represent a promising approach for displaying users’ bodies in XR environments. While previous methods have relied on colo...
Depth-aware salient object segmentation
Depth-aware salient object segmentation
Object segmentation is an important task which is widely employed in many computer vision applications such as object detection, tracking, recognition, and ret...
A SAM2-Driven RGB-T Annotation Pipeline with Thermal-Guided Refinement for Semantic Segmentation in Search-and-Rescue Scenes
A SAM2-Driven RGB-T Annotation Pipeline with Thermal-Guided Refinement for Semantic Segmentation in Search-and-Rescue Scenes
High-quality RGB–thermal infrared (RGB-T) semantic segmentation datasets are crucial for search-and-rescue (SAR) applications, yet their development is hindered by the scarcity of ...
RAW-Flow: Advancing RGB-to-RAW Image Reconstruction with Deterministic Latent Flow Matching
RAW-Flow: Advancing RGB-to-RAW Image Reconstruction with Deterministic Latent Flow Matching
RGB-to-RAW reconstruction, or the reverse modeling of a camera Image Signal Processing (ISP) pipeline, aims to recover high-fidelity RAW data from RGB images. Despite notable progr...
RGB-Guided Multi-Kernel Attention Feature Extraction Network for Hyperspectral Image Super-Resolution
RGB-Guided Multi-Kernel Attention Feature Extraction Network for Hyperspectral Image Super-Resolution
Hyperspectral image (HSI) super-resolution aims to reconstruct high-spatial-resolution images from their low-resolution counterparts while preserving critical spectral fidelity. Ex...
Object Tracking in RGB-T Videos Using Modal-Aware Attention Network and Competitive Learning
Object Tracking in RGB-T Videos Using Modal-Aware Attention Network and Competitive Learning
Object tracking in RGB-thermal (RGB-T) videos is increasingly used in many fields due to the all-weather and all-day working capability of the dual-modality imaging system, as well...

Back to Top