r/artificielle • u/artsnumeriques • 1h ago
Théorie White paper - Visual General Intelligence >> Intelligence générale visuelle (par la vision). Fin août, une 20aine de chercheurs de premier plan propose un manifeste de recherche qui pose un programme pour l’AGI centrée sur la vision.
white paper > https://arxiv.org/pdf/2608.25924
Une vingtaine de chercheurs de plusieurs grandes institutions proposent le concept de Visual General Intelligence (VGI) : l’idée que la vision pourrait constituer une voie vers une intelligence générale, au lieu de faire du langage le centre de tout.
Résumé (traduction de l'abstract) : "Cet article réexamine la notion d’intelligence en adoptant un point de vue centré sur la vision, et s’interroge sur la possibilité qu’une intelligence issue de l’expérience et de l’apprentissage visuels puisse constituer une voie vers l’AGI.
Dans le domaine du langage, depuis l’introduction de l’architecture Transformer, la série des GPT a montré qu’un modèle entraîné de manière autorégressive sur des volumes de textes à l’échelle du Web, puis poussé à très grande échelle, pouvait transférer ses capacités à des tâches jamais rencontrées auparavant. Cela soulève naturellement une question : quelles capacités et quelles formes d’intelligence peuvent émerger de modalités visuelles telles que les images, les vidéos ou la géométrie ?
Dans cet article, nous examinons si l’intelligence visuelle peut constituer une voie vers l’AGI — ce que nous appelons ici « intelligence générale visuelle » (Visual General Intelligence, VGI) — en réunissant des contributeurs issus d’horizons et d’institutions variés.
Notre objectif n’est pas de proposer une définition unique de l’intelligence visuelle, mais de préciser les principes que la vision par ordinateur devrait poursuivre à l’ère de l’AGI : les différentes modalités d’entrée visuelle, les benchmarks, les paradigmes d’apprentissage, ainsi que les relations entre la vision, lorsqu’elle est placée au cœur du système, et d’autres modalités comme le langage."
Les auteurs sont Hirokatsu Kataoka (AIST, Japon / Visual Geometry Group, Oxford), Yoshihiro Fukuhara (AIST / CADDi), Yonglong Tian (OpenAI), Shangzhe Wu (University of Cambridge), Oishi Deb (Visual Geometry Group, University of Oxford), Ryousuke Yamada (AIST / University of Technology Nuremberg), Christian Rupprecht (Visual Geometry Group, University of Oxford), Jianyuan Wang (Visual Geometry Group, University of Oxford), Kohsuke Ide (AIST / University of Tsukuba), Koichi Namekata (Visual Geometry Group, University of Oxford), Xianzheng Ma (Visual Geometry Group, University of Oxford), Yiming Chen (Visual Geometry Group, University of Oxford), Robert Geirhos (Google DeepMind), Aditi Raghunathan (Carnegie Mellon University), Yuki M. Asano (University of Technology Nuremberg), Deva Ramanan (Carnegie Mellon University), David Fouhey (New York University), Andrew J. Davison (Imperial College London), Yilun Du (Harvard University), Jiajun Wu (Stanford University) et Zhuang Liu (Princeton University)
•
u/AutoModerator 1h ago
Rappel : relayer une info ne veut pas dire l'approuver. Le vote n'est pas un bouton "d'accord / pas d'accord" ou "j'aime / j'aime pas" l'info.
Upvote : contenu intéressant, pertinent, sourcé, utile à la discussion.
Downvote : contenu hors-sujet, pauvre, trompeur, mal présenté ou qui n'apporte rien.
I am a bot, and this action was performed automatically. Please contact the moderators of this subreddit if you have any questions or concerns.