Combining text-based and vision-based semantics

Tran, Binh Giang

Combining text-based and vision-based semantics

diplomová práce (OBHÁJENO)

Zobrazit/otevřít

Záznam o průběhu obhajoby (30.05Kb)

Trvalý odkaz

http://hdl.handle.net/20.500.11956/49006

Identifikátory

SIS: 97195

Katalog UK: 990013845030106986

Oponent práce

Straková, Jana

Fakulta / součást

Matematicko-fyzikální fakulta

Obor

Matematická lingvistika

Katedra / ústav / klinika

Ústav formální a aplikované lingvistiky

Datum obhajoby

6. 9. 2011

Nakladatel

Univerzita Karlova, Matematicko-fyzikální fakulta

Jazyk

Angličtina

Známka

Výborně

Klíčová slova (česky)

semantics, semantic similarity measurement, text, image, vector space model

Klíčová slova (anglicky)

semantics, semantic similarity measurement, text, image, vector space model

Získání a reprezentace (lexikální) sémantické informace patří mezi nejdůležitější úlohy, které přispívají ke kvalitě automatického zpracování přirozeného jazyka (viz např. nedávná studie (Turney a Pantel, 2010)). V této práci je navržen nový, inovativní (ve skutečnosti první svého druhu) experimentální systém pro vytváření multimodálních distribučních sémantických modelů na základě kombinace nejlepších existujících modelů pracujících na základě zpracování textů nebo obrazu. Multimodální sémantický model testujeme pomocí úloh odhadu sémantické podobnosti, sémantického shlukování konceptů, a pomocí nedávno vyvinutého testu BLESS. Navrhujeme také efektivní algoritmus pro nalezení vhodných parametrů pro integraci multimodálních atributů za účelem získání robustnosti modelu. Naše experimenty ukazují, že navržená technika slibuje vysokou účinnost. Napříč různými experimenty se náš nejlepší multimodální model ukázal být na prvním místě. Při srovnání s jinými modely, které pracují pouze na základě analýzy textu, je náš navržený model mezi vůbec nejlepšími. V práci jsme zkoumali různé druhy vizuálních deskriptorů včetně metody SIFT, aby bylo možno posoudit, jak by se mohly metody počítačového vidění uplatnit v oblasti zpracování přirozeného jazyka. V práci ukazujeme důležité zjištění, že přidávání...

Abstrakt (anglicky)

Learning and representing semantics is one of the most important tasks that significantly contribute to some growing areas, as successful stories in the recent survey of Turney and Pantel (2010). In this thesis, we present an in- novative (and first) framework for creating a multimodal distributional semantic model from state of the art text-and image-based semantic models. We evaluate this multimodal semantic model on simulating similarity judgements, concept clustering and the newly introduced BLESS benchmark. We also propose an effective algorithm, namely Parameter Estimation, to integrate text- and image- based features in order to have a robust multimodal system. By experiments, we show that our technique is very promising. Across all experiments, our best multimodal model claims the first position. By relatively comparing with other text-based models, we are justified to affirm that our model can stay in the top line with other state of the art models. We explore various types of visual features including SIFT and other color SIFT channels in order to have prelim- inary insights about how computer-vision techniques should be applied in the natural language processing domain. Importantly, in this thesis, we show evi- dences that adding visual features (as the perceptual information coming from...

Citace dokumentu

Metadata

Zobrazit celý záznam