Notre histoire

NeoPhi est issu de plus de 7 années de recherche scientifique et de développement expérimental au sein de F.initiatives.
Fruit d’une équipe passionnée, fondée dès 2019 et composée principalement de docteur.e.s en informatique spécialisés en fouille de données, en apprentissage automatique et en traitement du langage naturel.
Il est né de la volonté de repousser les frontières de l’exploration des connaissances scientifiques.
S’appuyant sur l’observation des nombreuses années d’expérience de F.initiatives dans l’accompagnement des organisations sur leur R&D, les membres de cette équipe ont identifié un besoin croissant d’améliorer et d’accélérer les processus de revue de littérature et d’état de l’art au sein des services scientifiques et technologiques des entreprises.

Ce constat a tout d’abord mené à l’élaboration en 2021 d’un prototype interne, nommé NASA (Navigation in Academic and Scientific Articles), générant l’ensemble des concepts scientifiques associés à une recherche, sur la base de plus de 200 millions d’articles scientifiques, et permettant ainsi d’obtenir directement les références d’articles scientifiques spécifiques à chaque concept.
En parallèle, des travaux d’expérimentations sur le grand modèle de langue GPT-2 ont permis de poser les premières bases des fonctionnalités génératives, bien avant la déferlante issue de ChatGPT fin 2023.

Par la suite, les travaux sur le modèle GLiNER (Generalist Model for Named Entity Recognition), développé conjointement avec le Laboratoire d’Informatique de Paris Nord (LIPN), publié et présenté à la conférence internationale NAACL 2024 et mis à disposition en Open Source à l’ensemble de la communauté, ont favorisé l’amélioration de l’extraction de concepts pertinents et ainsi rendu possible la production d’une taxonomie de haute précision.

En 2024, la prolifération des textes générés par l’IA — suscitant des inquiétudes quant à la diffusion de fausses informations, au renforcement de la fraude académique et à l’érosion potentielle de la confiance dans les contenus numériques — a motivé la participation du Research Lab de F.initiatives au concours international SemEval. Ce concours a été l’opportunité d’élaborer un modèle de détection de texte multilingue généré par une IA, qui a obtenu la 2e place (sur 338 participant·es).

Tous ces travaux ont finalement abouti à différents prototypes (« Chat with Documents », « Chat with Papers », API internes, etc.) intégrant des fonctionnalités d’extraction d’information, de recommandation d’articles, d’exploration de taxonomies de concepts, de génération de texte, etc., utilisés par les consultant·es et analystes scientifiques dans le cadre de leurs interactions avec les équipes de recherche de leurs clients afin d’approfondir leur connaissance de l’existant.

L’usage ayant rapidement prouvé la puissance des outils développés, il a été décidé que cette innovation ne devait pas se limiter aux collaborateur·rices de F.initiatives mais devait être mise directement entre les mains des chercheur·euses et innovateur·rices du monde entier : c’est ainsi qu’a vu le jour la plateforme NeoPhi.