{"id":"https://openalex.org/W1942713348","doi":"https://doi.org/10.21437/interspeech.2015-239","title":"Fully unsupervised small-vocabulary speech recognition using a segmental Bayesian model","display_name":"Fully unsupervised small-vocabulary speech recognition using a segmental Bayesian model","publication_year":2015,"publication_date":"2015-09-06","ids":{"openalex":"https://openalex.org/W1942713348","doi":"https://doi.org/10.21437/interspeech.2015-239","mag":"1942713348"},"language":"en","primary_location":{"id":"doi:10.21437/interspeech.2015-239","is_oa":false,"landing_page_url":"https://doi.org/10.21437/interspeech.2015-239","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Interspeech 2015","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://www.pure.ed.ac.uk/ws/files/19947171/interspeech15_unsupTIDigits.pdf","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5040305929","display_name":"Herman Kamper","orcid":"https://orcid.org/0000-0003-2980-3475"},"institutions":[{"id":"https://openalex.org/I98677209","display_name":"University of Edinburgh","ror":"https://ror.org/01nrxwf90","country_code":"GB","type":"education","lineage":["https://openalex.org/I98677209"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Herman Kamper","raw_affiliation_strings":["University of Edinburgh"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Edinburgh","institution_ids":["https://openalex.org/I98677209"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103622427","display_name":"Aren Jansen","orcid":null},"institutions":[{"id":"https://openalex.org/I145311948","display_name":"Johns Hopkins University","ror":"https://ror.org/00za53h95","country_code":"US","type":"education","lineage":["https://openalex.org/I145311948"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Aren Jansen","raw_affiliation_strings":["Johns Hopkins University ("],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Johns Hopkins University (","institution_ids":["https://openalex.org/I145311948"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5075564798","display_name":"Sharon Goldwater","orcid":"https://orcid.org/0000-0002-7298-0947"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sharon Goldwater","raw_affiliation_strings":["School of Informatics"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Informatics","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":38,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"678","last_page":"682"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9987000226974487,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8099948763847351},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.6730139255523682},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6282844543457031},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.6041452884674072},{"id":"https://openalex.org/keywords/hidden-markov-model","display_name":"Hidden Markov model","score":0.5413105487823486},{"id":"https://openalex.org/keywords/word-error-rate","display_name":"Word error rate","score":0.5176416039466858},{"id":"https://openalex.org/keywords/speech-segmentation","display_name":"Speech segmentation","score":0.49575743079185486},{"id":"https://openalex.org/keywords/unsupervised-learning","display_name":"Unsupervised learning","score":0.4951392710208893},{"id":"https://openalex.org/keywords/categorical-variable","display_name":"Categorical variable","score":0.4936750829219818},{"id":"https://openalex.org/keywords/acoustic-model","display_name":"Acoustic model","score":0.482696533203125},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.44635236263275146},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.42832493782043457},{"id":"https://openalex.org/keywords/pronunciation","display_name":"Pronunciation","score":0.4274142384529114},{"id":"https://openalex.org/keywords/gibbs-sampling","display_name":"Gibbs sampling","score":0.42704877257347107},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.4102160334587097},{"id":"https://openalex.org/keywords/segmentation","display_name":"Segmentation","score":0.4009573459625244},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.37223172187805176},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.11596295237541199},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.10040038824081421}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8099948763847351},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.6730139255523682},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6282844543457031},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.6041452884674072},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.5413105487823486},{"id":"https://openalex.org/C40969351","wikidata":"https://www.wikidata.org/wiki/Q3516228","display_name":"Word error rate","level":2,"score":0.5176416039466858},{"id":"https://openalex.org/C207030507","wikidata":"https://www.wikidata.org/wiki/Q2266173","display_name":"Speech segmentation","level":3,"score":0.49575743079185486},{"id":"https://openalex.org/C8038995","wikidata":"https://www.wikidata.org/wiki/Q1152135","display_name":"Unsupervised learning","level":2,"score":0.4951392710208893},{"id":"https://openalex.org/C5274069","wikidata":"https://www.wikidata.org/wiki/Q2285707","display_name":"Categorical variable","level":2,"score":0.4936750829219818},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.482696533203125},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.44635236263275146},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.42832493782043457},{"id":"https://openalex.org/C2780844864","wikidata":"https://www.wikidata.org/wiki/Q184377","display_name":"Pronunciation","level":2,"score":0.4274142384529114},{"id":"https://openalex.org/C158424031","wikidata":"https://www.wikidata.org/wiki/Q1191905","display_name":"Gibbs sampling","level":3,"score":0.42704877257347107},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.4102160334587097},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.4009573459625244},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.37223172187805176},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.11596295237541199},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.10040038824081421},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C2524010","wikidata":"https://www.wikidata.org/wiki/Q8087","display_name":"Geometry","level":1,"score":0.0}],"mesh":[],"locations_count":4,"locations":[{"id":"doi:10.21437/interspeech.2015-239","is_oa":false,"landing_page_url":"https://doi.org/10.21437/interspeech.2015-239","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Interspeech 2015","raw_type":"proceedings-article"},{"id":"pmh:oai:pure.ed.ac.uk:publications/bf365345-3f75-4ffc-ad66-f24005605f6d","is_oa":true,"landing_page_url":"https://www.research.ed.ac.uk/portal/en/publications/fully-unsupervised-smallvocabulary-speech-recognition-using-a-segmental-bayesian-model(bf365345-3f75-4ffc-ad66-f24005605f6d).html","pdf_url":"https://www.pure.ed.ac.uk/ws/files/19947171/interspeech15_unsupTIDigits.pdf","source":{"id":"https://openalex.org/S4406922455","display_name":"Edinburgh Research Explorer","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":""},{"id":"pmh:oai:CiteSeerX.psu:10.1.1.720.501","is_oa":false,"landing_page_url":"http://citeseerx.ist.psu.edu/viewdoc/summary?doi=10.1.1.720.501","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"http://www.cstr.ed.ac.uk/downloads/publications/2015/interspeech15-unsupTIDigits.pdf","raw_type":"text"},{"id":"pmh:oai:pure.ed.ac.uk:openaire/bf365345-3f75-4ffc-ad66-f24005605f6d","is_oa":true,"landing_page_url":"https://www.research.ed.ac.uk/en/publications/bf365345-3f75-4ffc-ad66-f24005605f6d","pdf_url":null,"source":{"id":"https://openalex.org/S4406922455","display_name":"Edinburgh Research Explorer","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"other-oa","license_id":"https://openalex.org/licenses/other-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Kamper, H, Jansen, A & Goldwater, S 2015, Fully Unsupervised Small-Vocabulary Speech Recognition Using a Segmental Bayesian Model. in Proceedings of Interspeech 2015., 5. < https://www.isca-speech.org/archive/interspeech_2015/i15_0678.html >","raw_type":"contributionToPeriodical"}],"best_oa_location":{"id":"pmh:oai:pure.ed.ac.uk:publications/bf365345-3f75-4ffc-ad66-f24005605f6d","is_oa":true,"landing_page_url":"https://www.research.ed.ac.uk/portal/en/publications/fully-unsupervised-smallvocabulary-speech-recognition-using-a-segmental-bayesian-model(bf365345-3f75-4ffc-ad66-f24005605f6d).html","pdf_url":"https://www.pure.ed.ac.uk/ws/files/19947171/interspeech15_unsupTIDigits.pdf","source":{"id":"https://openalex.org/S4406922455","display_name":"Edinburgh Research Explorer","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":""},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","score":0.5799999833106995,"display_name":"Quality Education"}],"awards":[],"funders":[],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W1942713348.pdf","grobid_xml":"https://content.openalex.org/works/W1942713348.grobid-xml"},"referenced_works_count":30,"referenced_works":["https://openalex.org/W30845872","https://openalex.org/W51277926","https://openalex.org/W1503398984","https://openalex.org/W1525748279","https://openalex.org/W1539673959","https://openalex.org/W1545920196","https://openalex.org/W1577418252","https://openalex.org/W1997505733","https://openalex.org/W2010188467","https://openalex.org/W2020607164","https://openalex.org/W2022058071","https://openalex.org/W2052697931","https://openalex.org/W2057007397","https://openalex.org/W2059652594","https://openalex.org/W2097308346","https://openalex.org/W2100768664","https://openalex.org/W2104290444","https://openalex.org/W2107038463","https://openalex.org/W2114347655","https://openalex.org/W2116330964","https://openalex.org/W2116422968","https://openalex.org/W2126203737","https://openalex.org/W2126377586","https://openalex.org/W2140991203","https://openalex.org/W2152131029","https://openalex.org/W2152483743","https://openalex.org/W2166270474","https://openalex.org/W2168277610","https://openalex.org/W2799046698","https://openalex.org/W2997701990"],"related_works":["https://openalex.org/W3081187864","https://openalex.org/W4380605396","https://openalex.org/W2803306015","https://openalex.org/W3133352777","https://openalex.org/W2008737763","https://openalex.org/W151018310","https://openalex.org/W2784059283","https://openalex.org/W4319779560","https://openalex.org/W4385611764","https://openalex.org/W1970482590"],"abstract_inverted_index":{"Current":[0],"supervised":[1],"speech":[2,8,16,44,56,148,152],"technology":[3],"relies":[4],"heavily":[5],"on":[6],"tran-scribed":[7],"and":[9],"pronunciation":[10],"dictionaries.":[11],"In":[12,63],"settings":[13],"where":[14],"unlabelled":[15,42],"data":[17],"alone":[18],"is":[19,73,131],"available,":[20],"unsupervised":[21,52,113,147,154],"methods":[22],"are":[23],"required":[24],"to":[25,115,134],"discover":[26,135],"categorical":[27],"linguistic":[28],"structure":[29],"directly":[30],"from":[31],"the":[32,55,79,112,129,137,143],"audio.":[33],"We":[34,99],"present":[35,141],"a":[36,50,66,76,83,88,105,122],"novel":[37],"Bayesian":[38],"model":[39,80,91,120,130],"which":[40],"seg-ments":[41],"input":[43],"into":[45],"word-like":[46],"units,":[47],"resulting":[48],"in":[49,57,75,92,104,142],"complete":[51],"transcription":[53],"of":[54,59],"terms":[58],"discovered":[60],"word":[61,68,101,139,150],"types.":[62],"our":[64],"approach,":[65],"potential":[67],"segment":[69],"(of":[70],"arbitrary":[71],"length)":[72],"embedded":[74],"fixed-dimensional":[77],"space;":[78],"(implemented":[81],"as":[82],"Gibbs":[84],"sampler)":[85],"then":[86],"builds":[87],"whole-word":[89],"acoustic":[90],"this":[93],"space":[94],"while":[95],"jointly":[96],"doing":[97],"seg-mentation.":[98],"report":[100],"error":[102],"rates":[103],"connected":[106],"digit":[107],"recog-nition":[108],"task":[109],"by":[110],"mapping":[111],"output":[114],"ground":[116],"truth":[117],"transcriptions.":[118],"Our":[119],"outperforms":[121],"previously":[123],"developed":[124],"HMM-based":[125],"system,":[126],"even":[127],"when":[128],"not":[132],"constrained":[133],"only":[136],"11":[138],"types":[140],"data.":[144],"Index":[145],"Terms:":[146],"processing,":[149],"discovery,":[151],"segmentation,":[153],"learning,":[155],"segmental":[156],"models":[157],"1.":[158]},"counts_by_year":[{"year":2022,"cited_by_count":2},{"year":2020,"cited_by_count":1},{"year":2019,"cited_by_count":6},{"year":2018,"cited_by_count":7},{"year":2017,"cited_by_count":10},{"year":2016,"cited_by_count":10},{"year":2015,"cited_by_count":2}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
