« Dans un contexte d’augmentation des volumétries des données et de réduction des temps de traitement, la Bibliothèque nationale de France est confrontée à plusieurs défis et évolutions. Afin de collecter, préserver, décrire et permettre l’étude d’ensembles de données massifs et hétérogènes, elle fait non seulement appel aux méthodes relevant des…
« In this paper we describe our current efforts towards building a framework that extends the functionality of an Open Access Repository by implementing processes to incorporate the ongoing trends in social media into the context of a digital collection. We refer to these processes collectively as the Social Media Engine.…
« Many data sets encompass structured data fields with embedded free text fields. The text fields allow customers and workers to input information which cannot be encoded in structured fields. Several approaches use structured and unstructured data in isolated analyses. The result of isolated mining of structured data fields misses crucial…
« Un nouveau paquet dénommé R.temis a été mis en ligne sur le CRAN. Il fournit des fonctions utilisables dans des scripts sans interface graphique et compatibles avec RStudio. (…) »
« Depuis plusieurs décennies, on observe une utilisation croissante des systèmes d’information, ce qui provoque une augmentation exponentielle des données textuelles. Bien que l’aspect volumétrique de ces données textuelles soit résolu, sa dimension hétérogène reste un défi pour la communauté scientifique. (…) »
« (…) L’initiative est organisée en deux temps. Les chercheurs/ses et consortium académiques sont invités à envoyer une lettre d’intention avant le 8 mars 2019 à l’A.N.R.
L’A.N.R. et le C.N.R.S. constitueront un comité d’organisation qui analysera et retiendra un ensemble d’intentions. Celles-ci seront présentées lors d’une journée de rencontre prévue…
« La première séance du séminaire « Indexer les corpus numériques », organisée par Fabienne Vial-Bonacci (CNRS, IHRIM) et Emmanuelle Perrin (Université Jean Monnet, IHRIM) s’est tenue le 1er février 2019 à l’université Jean Monnet – Saint-Étienne.
Soutenue par le consortium Cahier et la MSH Lyon-Saint-Etienne, cette séance a réuni…
« Cet article est le premier d’une série de retours d’expériences sur les travaux menés par le projet Numapresse au cours de l’année 2018, sur l’analyse automatisée de grands corpus de presse numérisée du XIXe et du XXe siècle. (…) »
« The curation of neuroscience entities is crucial to ongoing efforts in neuroinformatics and computational neuroscience, such as those being deployed in the context of continuing large-scale brain modelling projects. However, manually sifting through thousands of articles for new information about modelled entities is a painstaking and low-reward task. Text mining…
« En 2015 naissait le dispositif CERCLES (voir le billet), mis en place par l’ABES pour accompagner, aider et valoriser un établissement souhaitant s’investir sur l’enrichissement des données d’un corpus de documents précis.
(…) Dès le début, l’ABES annonçait son intention de créer un cercle vertueux et d’étendre…