{"id":"https://openalex.org/W2102691465","doi":"https://doi.org/10.1109/icme.2004.1394602","title":"A multi-stream audio-video large-vocabulary Mandarin Chinese speech database","display_name":"A multi-stream audio-video large-vocabulary Mandarin Chinese speech database","publication_year":2005,"publication_date":"2005-03-21","ids":{"openalex":"https://openalex.org/W2102691465","doi":"https://doi.org/10.1109/icme.2004.1394602","mag":"2102691465"},"language":"en","primary_location":{"id":"doi:10.1109/icme.2004.1394602","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icme.2004.1394602","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2004 IEEE International Conference on Multimedia and Expo (ICME) (IEEE Cat. No.04TH8763)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5097063841","display_name":"Luhong Liangi","orcid":null},"institutions":[{"id":"https://openalex.org/I1343180700","display_name":"Intel (United States)","ror":"https://ror.org/01ek73717","country_code":"US","type":"company","lineage":["https://openalex.org/I1343180700"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Luhong Liangi","raw_affiliation_strings":["Syst. Technol. Labs., Intel Corp., Santa Clara, CA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Syst. Technol. Labs., Intel Corp., Santa Clara, CA, USA","institution_ids":["https://openalex.org/I1343180700"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5064904136","display_name":"Yu Luo","orcid":"https://orcid.org/0000-0002-7939-5505"},"institutions":[{"id":"https://openalex.org/I1343180700","display_name":"Intel (United States)","ror":"https://ror.org/01ek73717","country_code":"US","type":"company","lineage":["https://openalex.org/I1343180700"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Yu Luo","raw_affiliation_strings":["System Technology Labs, Intel Corporation, Santa Clara, CA, U.S.A"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"System Technology Labs, Intel Corporation, Santa Clara, CA, U.S.A","institution_ids":["https://openalex.org/I1343180700"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5025881564","display_name":"Feiyue Huang","orcid":"https://orcid.org/0009-0006-8834-9646"},"institutions":[{"id":"https://openalex.org/I99065089","display_name":"Tsinghua University","ror":"https://ror.org/03cve4549","country_code":"CN","type":"education","lineage":["https://openalex.org/I99065089"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Feiyue Huang","raw_affiliation_strings":["Tsinghua University, eijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Tsinghua University, eijing, China","institution_ids":["https://openalex.org/I99065089"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5113481101","display_name":"Ara Nefian","orcid":null},"institutions":[{"id":"https://openalex.org/I1343180700","display_name":"Intel (United States)","ror":"https://ror.org/01ek73717","country_code":"US","type":"company","lineage":["https://openalex.org/I1343180700"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"A.V. Nefian","raw_affiliation_strings":["System Technology Labs, Intel Corporation, Santa Clara, CA, U.S.A"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"System Technology Labs, Intel Corporation, Santa Clara, CA, U.S.A","institution_ids":["https://openalex.org/I1343180700"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":1.0188,"has_fulltext":false,"cited_by_count":9,"citation_normalized_percentile":{"value":0.74523932,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":94},"biblio":{"volume":"18","issue":null,"first_page":"1787","last_page":"1790"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9973000288009644,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10901","display_name":"Advanced Data Compression Techniques","score":0.9959999918937683,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8411799669265747},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.778118908405304},{"id":"https://openalex.org/keywords/pronunciation","display_name":"Pronunciation","score":0.7461650371551514},{"id":"https://openalex.org/keywords/mandarin-chinese","display_name":"Mandarin Chinese","score":0.7051903605461121},{"id":"https://openalex.org/keywords/audio-mining","display_name":"Audio mining","score":0.6874160766601562},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.6042062044143677},{"id":"https://openalex.org/keywords/speaker-recognition","display_name":"Speaker recognition","score":0.4599738121032715},{"id":"https://openalex.org/keywords/viseme","display_name":"Viseme","score":0.45988285541534424},{"id":"https://openalex.org/keywords/speech-corpus","display_name":"Speech corpus","score":0.45764464139938354},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.4494296908378601},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.43534958362579346},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.4117889404296875},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.39334043860435486},{"id":"https://openalex.org/keywords/database","display_name":"Database","score":0.367441862821579},{"id":"https://openalex.org/keywords/acoustic-model","display_name":"Acoustic model","score":0.329542338848114},{"id":"https://openalex.org/keywords/speech-synthesis","display_name":"Speech synthesis","score":0.2711976170539856}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8411799669265747},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.778118908405304},{"id":"https://openalex.org/C2780844864","wikidata":"https://www.wikidata.org/wiki/Q184377","display_name":"Pronunciation","level":2,"score":0.7461650371551514},{"id":"https://openalex.org/C138954614","wikidata":"https://www.wikidata.org/wiki/Q9192","display_name":"Mandarin Chinese","level":2,"score":0.7051903605461121},{"id":"https://openalex.org/C157968479","wikidata":"https://www.wikidata.org/wiki/Q3079876","display_name":"Audio mining","level":4,"score":0.6874160766601562},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.6042062044143677},{"id":"https://openalex.org/C133892786","wikidata":"https://www.wikidata.org/wiki/Q1145189","display_name":"Speaker recognition","level":2,"score":0.4599738121032715},{"id":"https://openalex.org/C33767174","wikidata":"https://www.wikidata.org/wiki/Q371190","display_name":"Viseme","level":4,"score":0.45988285541534424},{"id":"https://openalex.org/C91863865","wikidata":"https://www.wikidata.org/wiki/Q4349497","display_name":"Speech corpus","level":3,"score":0.45764464139938354},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.4494296908378601},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.43534958362579346},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.4117889404296875},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.39334043860435486},{"id":"https://openalex.org/C77088390","wikidata":"https://www.wikidata.org/wiki/Q8513","display_name":"Database","level":1,"score":0.367441862821579},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.329542338848114},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.2711976170539856},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icme.2004.1394602","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icme.2004.1394602","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2004 IEEE International Conference on Multimedia and Expo (ICME) (IEEE Cat. No.04TH8763)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.6800000071525574,"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[{"id":"https://openalex.org/F4320322392","display_name":"Tsinghua University","ror":"https://ror.org/03cve4549"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":16,"referenced_works":["https://openalex.org/W98035269","https://openalex.org/W172154728","https://openalex.org/W1492403062","https://openalex.org/W2034486604","https://openalex.org/W2083792893","https://openalex.org/W2098923380","https://openalex.org/W2107634464","https://openalex.org/W2121430128","https://openalex.org/W2130602224","https://openalex.org/W2155276444","https://openalex.org/W2992447100","https://openalex.org/W3099202502","https://openalex.org/W3143803406","https://openalex.org/W6604012948","https://openalex.org/W6679442541","https://openalex.org/W6785273600"],"related_works":["https://openalex.org/W2157598242","https://openalex.org/W2620660273","https://openalex.org/W2619911963","https://openalex.org/W3109010073","https://openalex.org/W3151376046","https://openalex.org/W3089379469","https://openalex.org/W2903652364","https://openalex.org/W2147630093","https://openalex.org/W2794873916","https://openalex.org/W1560013842"],"abstract_inverted_index":{"We":[0,36],"present":[1],"the":[2,39,44,47,50,55],"acquisition":[3],"and":[4,25,33,49,73,84],"content":[5],"of":[6,18,30,46,58],"a":[7,28],"multi-stream":[8],"audio-visual":[9,66,81],"large-vocabulary":[10,72],"database":[11,16,61],"in":[12,65],"Mandarin":[13],"Chinese.":[14],"The":[15,60],"consists":[17],"17,000":[19],"utterances":[20,48],"spoken":[21],"by":[22,27],"225":[23],"people":[24],"captured":[26],"set":[29],"seven":[31],"cameras":[32],"12":[34],"microphones.":[35],"also":[37],"provide":[38],"label":[40],"files":[41,52],"that":[42,53],"describe":[43],"endpoints":[45],"script":[51],"represent":[54],"actual":[56],"pronunciation":[57],"speech.":[59],"can":[62],"be":[63],"used":[64],"speech":[67,79],"recognition":[68],"(AVSR)":[69],"for":[70],"both":[71],"small":[74],"tasks,":[75],"microphone":[76],"array":[77],"based":[78],"recognition,":[80],"speaker":[82],"identification":[83],"3D":[85],"face":[86],"modeling.":[87]},"counts_by_year":[{"year":2022,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
