Amb motiu del tancament d'estiu, la validació de documents es reprendrà a partir del 28 d'agost de 2026. Disculpeu les molèsties.
Con motivo del cierre de verano, la validación de documentos se reanudará a partir del 28 de agosto de 2026. Disculpad las molestias
Due to the summer closure, document validation will resume starting August 28, 2026. We apologize for any inconvenience.

Tipus de document

Treball de fi de grau

Data de publicació

Llicència de publicació

cc-by-nc-nd (c) Ouhida Ben Romdhane, Mohamed Aziz, 2026
Si us plau utilitzeu sempre aquest identificador per citar o enllaçar aquest document: https://hdl.handle.net/2445/230473

Embedding Geometry in Encoder Selection for Biomedical NLP

Títol de la revista

ISSN de la revista

Títol del volum

Recurs relacionat

Resum

[eng] As the digitisation of healthcare generates vast amounts of unstructured texts, Natural Language Processing tasks like Named Entity Recognition have become essential for clinical information extraction and processing. However, dedicated biomedical language models remain heavily concentrated in English, leaving low-resource European languages dependent on suboptimal multilingual general-purpose models. This thesis addresses this bottleneck by exploring whether geometric properties of pre-trained embedding spaces can serve as a cheap predictor for cross-lingual transferability of biomedical encoders. Correlation analysis across a wide selection of embedding similarity metrics identifies two stable, internally coherent co-prediction clusters, which are then evaluated against downstream NER performance across 7 European languages. Results show a predictive capacity bound by language-family constraints: Romance-language models demonstrate high concordance between geometric similarity and NER transferability, while Slavic and Germanic models exhibit weaker agreement. These findings establish embedding geometry as a viable, albeit conditional, proxy for cross-lingual transfer, warranting a follow-up large-scale study. [cat] A mesura que la digitalització del sistema sanitari genera grans quantitats de documents desestructurats, les tasques de Processament de Llenguatge Natural, com pot ser el Reconeixement d’Entitats, s’han tornat essencials per a l’extracció i el processament de la informació clínica. El desenvolupament, però, de models biomèdics, ha estat concentrat principalment en l’anglès, deixant de banda a les llengües Europees de baixos recursos, qui l’única alternativa que troben és utilitzar models multilingües de domini general. Aquest TFG, buscant tractar aquesta limitació, estudia si és possible utilitzar la similitud de l’espai d’embedding com a indicador de transferibilitat multilingüe de codificadors biomèdics. Una anàlisi de correlacions entre una gran selecció de mètriques de similitud identifiquen dos clústers estables i coherents, els quals són testejats contra tasques de RE en 7 idiomes europeus. Els resultats demostren una capacitat predictiva limitada per la família lingüística: els models de família romànica mostren una alta concordança entre la semblança de l’espai d’embeddings i la transferibilitat del RE, mentre que models Eslaus o Germànics mostren correlacions més limitades. Aquestes troballes estableixen a la geometria dels embeddings com a un indicador, tot sigui condicional, de transferibilitat multilingüe, motivant un estudi a més gran escala.

Descripció

Treballs Finals de Grau d'Enginyeria Biomèdica. Facultat de Medicina i Ciències de la Salut. Universitat de Barcelona. Curs: 2025-2026. Tutor/Director: Núria Gavara, Fernando Gallego, Martin Krallinger

Citació

Citació

OUHIDA BEN ROMDHANE, Mohamed Aziz. Embedding Geometry in Encoder Selection for Biomedical NLP. [consulted: 29 of August of 2026]. Available at: https://hdl.handle.net/2445/230473

Exportar metadades

JSON - METS

Compartir registre