Skip to main content

Arrakasta kasuak

LBRAND, euskara eta katalanaren marka soziala automatikoki aztertzeko tresna:

LBRAND
LBRAND proiektuan, euskara eta katalanaren marka soziala modu automatiko eta jarraituan aztertzeko adimen artifizialeko tresna garatu da. Sistemak prentsa digitaleko albisteak eta sare sozialetako mezuak biltzen ditu, hizkuntzei buruz ari diren testuak identifikatzen ditu, eta marka horien inguruko pertzepzioa neurtzen du hainbat adierazleren bidez. EHUko NIK ikerketa-taldearentzat diseinatutako tresna da, euskararen eta katalanaren marka-azterketa eskala handian egiteko.

Azalpen orokorra

LBRAND proiektuan, euskara eta katalanaren marka soziala modu automatiko eta jarraituan aztertzeko adimen artifizialeko tresna garatu da. Sistemak prentsa digitaleko albisteak eta sare sozialetako mezuak biltzen ditu, hizkuntzei buruz ari diren testuak identifikatzen ditu, eta marka horien inguruko pertzepzioa neurtzen du hainbat adierazleren bidez. EHUko NIK ikerketa-taldearentzat diseinatutako tresna da, euskararen eta katalanaren marka-azterketa eskala handian egiteko.

Erronka

Erronka nagusia izan da urte askotako eta iturri askotako testu-bilduma handiak tratatzea —37 hedabide digitaletako albisteak eta X plataformako mezuak—, eta horien artean benetan euskara edo katalanari buruz ari diren edukiak automatikoki bereiztea. Horrez gain, hizkuntzen presentzia neurtzeaz harago, alderdi hauek modu fidagarrian inferitzea eskatzen zuen: testuetan agertzen diren jarrerak, hizkuntzekin lotutako erakunde eta pertsonak, gai nagusiak eta marka bakoitzaren kokapena —landa-eremua vs hiri-eremua eta tradizioa vs modernitatea ardatzetan—.

Elkarlana

EHUko NIK taldearekin lankidetzan garatu da.

Emaitza

Emaitza LBRAND izeneko plataforma interaktiboa da, euskara eta katalanaren marka aztertzeko adierazle nagusiak kontsultatzeko aukera ematen duena: presentzia-maila, markarekiko jarrera, hizkuntzekin lotutako erakunde eta pertsonalitateak, gai-elkarteak eta kokapen sinbolikoak. Adierazle horiek automatikoki kalkulatzeko, sistemak hizkuntza naturalaren ulermen aurreratua erabiltzen du, besteak beste RoBERTa eta Llama 3.3 70B LLM ereduen bidez, eta 2008-2024 arteko albisteak nahiz 2008-2022 arteko sare sozialetako mezuak aztertzeko gaitasuna eskaintzen du.