Inssi

Helecon

Vocabulary

Tenttu

search query: @keyword information retrieval / total: 18

reference: 14 / 18

« previous | next »

Author:	Turunen, Ville Tapani
Title:	Spoken document retrieval in Finnish based on morpheme-like subword units
	Morfeemien kaltaisiin yksiköihin perustuva suomenkielinen puhehaku
Publication type:	Master's thesis
Publication year:	2005
Pages:	61 Language: eng
Department/School:	Tietotekniikan osasto
Main subject:	Informaatiotekniikka (T-61)
Supervisor:	Oja, Erkki
Instructor:	Kurimo, Mikko
OEVS:	Electronic archive copy is available via Aalto Thesis Database. Instructions close Reading digital theses in the closed network of the Aalto University Harald Herlin Learning Centre In the closed network of Learning Centre you can read digital and digitized theses not available in the open network. The Learning Centre contact details and opening hours: https://learningcentre.aalto.fi/en/harald-herlin-learning-centre/ You can read theses on the Learning Centre customer computers, which are available on all floors. Logging on to the customer computers Aalto University staff members log on to the customer computer using the Aalto username and password. Other customers log on using a shared username and password. Opening a thesis On the desktop of the customer computers, you will find an icon titled: Aalto Thesis Database Click on the icon to search for and open the thesis you are looking for from Aaltodoc database. You can find the thesis file by clicking the link on the OEV or OEVS field. Reading the thesis You can either print the thesis or read it on the customer computer screen. You cannot save the thesis file on a flash drive or email it. You cannot copy text or images from the file. You cannot edit the file. Printing the thesis You can print the thesis for your personal study or research use. Aalto University students and staff members may print black-and-white prints on the PrintingPoint devices when using the computer with personal Aalto username and password. Color printing is possible using the printer u90203-psc3, which is located near the customer service. Color printing is subject to a charge to Aalto University students and staff members. Other customers can use the printer u90203-psc3. All printing is subject to a charge to non-University members.
Location:	P1 Ark Aalto 8597 \| Archive
Keywords:	spoken document retrieval speech recognition information retrieval puhehaku puhetiedonhaku puheentunnistus tiedonhaku
Abstract (fin):	Puhedokumenttien haku, eli kiinnostavien kohtien löytäminen tallennetusta puheesta, on haastava ongelma. Muita kieliä varten kehitettyjä menetelmiä ei voi käyttää suomenkieliseen puhehakuun sellaisenaan, koska suomenkielessä on erityispiirteitä, kuten suuri määrä eri sijamuotoja. Aiemmin on käytetty sanoihin tai fooneihin perustuvia ratkaisumalleja. Sanapohjaisen järjestelmän haittapuoli on puheentunnistimen rajoitettu sanasto, kun taas foonipohjainen järjestelmä kärsii korkeista virhemääristä. Tässä työssä käytetään morfeemien kaltaisiin yksiköihin perustuvaa puheentunnistinta, joka pystyy saavuttamaan alhaisen virhemäärän ja samalla tarjoamaan rajoittamattoman sanaston tunnistuksen. Puhe tunnistetaan jonona morfeemien kaltaisia yksiköitä, sanarajat merkattuina. Transkriptio voidaan indeksoida käyttäen indeksitermeinä joko sanoja tai morfeemein kaltaisia yksiköitä. Sanaindeksiä varten sananmuodot palautetaan perusmuotoihinsa morfologista analysaattoria käyttäen. Morfeemien kaltaiset yksiköt todetaan toimivan hyvin indeksitermeinä, suorituskyky on yhtä hyvä tai parempi kuin perusmuotoisilla sanoilla. Morfologisen analysaattorin käyttö voidaan siis välttää ja prosessi yksinkertaistuu. Työssä tutkittiin ja kokeiltiin myös menetelmiä tunnistusvirheiden haittavaikutuksen pienentämiseen. Ensimmäiseksi muodostettiin indeksi, joka yhdistää morfeemi- ja perusmuotoindeksit. Toiseksi muokattiin puheentunnistinta niin, että transkriptioon lisättiin vaihtoehtoisia tunnistustuloksia. Kolmanneksi laajennettiin kysymyslauseita niin, että rinnakkaisesta tekstikorpuksesta lisättiin niihin relevantteja sanoja. Kaikki menetelmät havaittiin hyödyllisiksi sekä absoluuttisen suorituskyvyn parantamiseen, että tunnistetun tekstin ja alkuperäisen tekstin hakujen suorituskykyjen välisen eron pienentämiseen. Parhaat tulokset saavutettiin kysymyslauseiden laajentamisella, jolla suorituskyky nousee samalle tasolle kuin tekstidokumenttien haulla, jopa tunnistuksi11a, joiden virhemäärä on suuri. Lopuksi todettiin, että hakujen suorituskyky ei huonone herkästi vaikka tunnistusvirheiden määrä lisääntyisi.
ED:	2006-01-04

INSSI record number: 30461

« previous | next »

INSSI