{"id":"https://openalex.org/W2142283335","doi":"https://doi.org/10.1109/icassp.2010.5495597","title":"A new approach for robust realtime Voice Activity Detection using spectral pattern","display_name":"A new approach for robust realtime Voice Activity Detection using spectral pattern","publication_year":2010,"publication_date":"2010-01-01","ids":{"openalex":"https://openalex.org/W2142283335","doi":"https://doi.org/10.1109/icassp.2010.5495597","mag":"2142283335"},"language":"en","primary_location":{"id":"doi:10.1109/icassp.2010.5495597","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2010.5495597","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2010 IEEE International Conference on Acoustics, Speech and Signal Processing","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5013841570","display_name":"Mohammad Hossein Moattar","orcid":"https://orcid.org/0000-0002-8968-6744"},"institutions":[{"id":"https://openalex.org/I158248296","display_name":"Amirkabir University of Technology","ror":"https://ror.org/04gzbav43","country_code":"IR","type":"education","lineage":["https://openalex.org/I158248296"]}],"countries":["IR"],"is_corresponding":false,"raw_author_name":"M. H. Moattar","raw_affiliation_strings":["Laboratory for Intelligent Signal and speech Processing, Computer Engineering and Information, Technology Department, Amirkabir University of Technology\uc2a0, Tehran, Iran","Laboratory for Intelligent Signal and Speech Processing, Computer Engineering and Information Technology Dept., Amirkabir University of Technology, Tehran, Iran"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Laboratory for Intelligent Signal and speech Processing, Computer Engineering and Information, Technology Department, Amirkabir University of Technology\uc2a0, Tehran, Iran","institution_ids":["https://openalex.org/I158248296"]},{"raw_affiliation_string":"Laboratory for Intelligent Signal and Speech Processing, Computer Engineering and Information Technology Dept., Amirkabir University of Technology, Tehran, Iran","institution_ids":["https://openalex.org/I158248296"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5048230415","display_name":"Mohammad Mehdi Homayounpour","orcid":"https://orcid.org/0000-0002-2379-4427"},"institutions":[{"id":"https://openalex.org/I158248296","display_name":"Amirkabir University of Technology","ror":"https://ror.org/04gzbav43","country_code":"IR","type":"education","lineage":["https://openalex.org/I158248296"]}],"countries":["IR"],"is_corresponding":false,"raw_author_name":"M. M. Homayounpour","raw_affiliation_strings":["Laboratory for Intelligent Signal and speech Processing, Computer Engineering and Information, Technology Department, Amirkabir University of Technology\uc2a0, Tehran, Iran","Laboratory for Intelligent Signal and Speech Processing, Computer Engineering and Information Technology Dept., Amirkabir University of Technology, Tehran, Iran"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Laboratory for Intelligent Signal and speech Processing, Computer Engineering and Information, Technology Department, Amirkabir University of Technology\uc2a0, Tehran, Iran","institution_ids":["https://openalex.org/I158248296"]},{"raw_affiliation_string":"Laboratory for Intelligent Signal and Speech Processing, Computer Engineering and Information Technology Dept., Amirkabir University of Technology, Tehran, Iran","institution_ids":["https://openalex.org/I158248296"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5008433002","display_name":"Nima Khademi Kalantari","orcid":"https://orcid.org/0000-0002-2588-9219"},"institutions":[{"id":"https://openalex.org/I158248296","display_name":"Amirkabir University of Technology","ror":"https://ror.org/04gzbav43","country_code":"IR","type":"education","lineage":["https://openalex.org/I158248296"]}],"countries":["IR"],"is_corresponding":false,"raw_author_name":"Nima Khademi Kalantari","raw_affiliation_strings":["Electrical Engineering Department, Amirkabir University of Technology\uc2a0, Tehran, Iran","Electrical Engineering Department, Amirkabir University of Technology, Tehran-IRAN"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Electrical Engineering Department, Amirkabir University of Technology\uc2a0, Tehran, Iran","institution_ids":["https://openalex.org/I158248296"]},{"raw_affiliation_string":"Electrical Engineering Department, Amirkabir University of Technology, Tehran-IRAN","institution_ids":["https://openalex.org/I158248296"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I158248296"],"apc_list":null,"apc_paid":null,"fwci":3.2012,"has_fulltext":false,"cited_by_count":26,"citation_normalized_percentile":{"value":0.93628594,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":89,"max":98},"biblio":{"volume":null,"issue":null,"first_page":"4478","last_page":"4481"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10860","display_name":"Speech and Audio Processing","score":1.0,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9994999766349792,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.763779878616333},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.7207012176513672},{"id":"https://openalex.org/keywords/voice-activity-detection","display_name":"Voice activity detection","score":0.7062968611717224},{"id":"https://openalex.org/keywords/frame","display_name":"Frame (networking)","score":0.6248666644096375},{"id":"https://openalex.org/keywords/signal","display_name":"SIGNAL (programming language)","score":0.6011763215065002},{"id":"https://openalex.org/keywords/measure","display_name":"Measure (data warehouse)","score":0.5716895461082458},{"id":"https://openalex.org/keywords/noise","display_name":"Noise (video)","score":0.5409132242202759},{"id":"https://openalex.org/keywords/vowel","display_name":"Vowel","score":0.5349942445755005},{"id":"https://openalex.org/keywords/overhead","display_name":"Overhead (engineering)","score":0.5254192352294922},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.43497782945632935},{"id":"https://openalex.org/keywords/speech-enhancement","display_name":"Speech enhancement","score":0.429650217294693},{"id":"https://openalex.org/keywords/speech-coding","display_name":"Speech coding","score":0.42713767290115356},{"id":"https://openalex.org/keywords/speech-processing","display_name":"Speech processing","score":0.4210056662559509},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3905278146266937},{"id":"https://openalex.org/keywords/data-mining","display_name":"Data mining","score":0.15909987688064575},{"id":"https://openalex.org/keywords/noise-reduction","display_name":"Noise reduction","score":0.15585565567016602},{"id":"https://openalex.org/keywords/telecommunications","display_name":"Telecommunications","score":0.08588862419128418}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.763779878616333},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.7207012176513672},{"id":"https://openalex.org/C204201278","wikidata":"https://www.wikidata.org/wiki/Q1332614","display_name":"Voice activity detection","level":3,"score":0.7062968611717224},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.6248666644096375},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.6011763215065002},{"id":"https://openalex.org/C2780009758","wikidata":"https://www.wikidata.org/wiki/Q6804172","display_name":"Measure (data warehouse)","level":2,"score":0.5716895461082458},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.5409132242202759},{"id":"https://openalex.org/C2779581591","wikidata":"https://www.wikidata.org/wiki/Q36244","display_name":"Vowel","level":2,"score":0.5349942445755005},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.5254192352294922},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.43497782945632935},{"id":"https://openalex.org/C2776182073","wikidata":"https://www.wikidata.org/wiki/Q7575395","display_name":"Speech enhancement","level":3,"score":0.429650217294693},{"id":"https://openalex.org/C13895895","wikidata":"https://www.wikidata.org/wiki/Q3270773","display_name":"Speech coding","level":2,"score":0.42713767290115356},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.4210056662559509},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3905278146266937},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.15909987688064575},{"id":"https://openalex.org/C163294075","wikidata":"https://www.wikidata.org/wiki/Q581861","display_name":"Noise reduction","level":2,"score":0.15585565567016602},{"id":"https://openalex.org/C76155785","wikidata":"https://www.wikidata.org/wiki/Q418","display_name":"Telecommunications","level":1,"score":0.08588862419128418},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0},{"id":"https://openalex.org/C115961682","wikidata":"https://www.wikidata.org/wiki/Q860623","display_name":"Image (mathematics)","level":2,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icassp.2010.5495597","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icassp.2010.5495597","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2010 IEEE International Conference on Acoustics, Speech and Signal Processing","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.6399999856948853,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[{"id":"https://openalex.org/F4320324891","display_name":"Iran Telecommunication Research Center","ror":"https://ror.org/01a3g2z22"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":12,"referenced_works":["https://openalex.org/W36345725","https://openalex.org/W1837709900","https://openalex.org/W2020969069","https://openalex.org/W2090499995","https://openalex.org/W2109788549","https://openalex.org/W2141063921","https://openalex.org/W2149053750","https://openalex.org/W2152395643","https://openalex.org/W2156038773","https://openalex.org/W2166607750","https://openalex.org/W6638754818","https://openalex.org/W6676413359"],"related_works":["https://openalex.org/W2120771489","https://openalex.org/W2496295964","https://openalex.org/W1546240199","https://openalex.org/W2051376034","https://openalex.org/W2294333436","https://openalex.org/W1976952689","https://openalex.org/W2336887028","https://openalex.org/W3211091508","https://openalex.org/W642007152","https://openalex.org/W2056066842"],"abstract_inverted_index":{"In":[0],"this":[1,26,66,87],"paper":[2],"a":[3,12],"Voice":[4],"Activity":[5],"Detection":[6],"approach":[7,30,94,112],"is":[8,50,113],"proposed":[9,29,93,111],"which":[10,76],"applies":[11],"voting":[13],"algorithm":[14,103],"to":[15],"decide":[16],"on":[17,115],"the":[18,28,39,61,77,80,99,102],"existence":[19],"of":[20,41,44,63,101],"speech":[21,57,81],"in":[22,56,60,71,75],"audio":[23],"signal.":[24,82],"For":[25],"purpose,":[27],"uses":[31],"three":[32],"different":[33,116],"short":[34],"time":[35],"features":[36],"along":[37,89],"with":[38,90,118],"pattern":[40,49],"spectral":[42],"peaks":[43,48],"every":[45],"frame.":[46],"Spectral":[47],"appropriate":[51],"for":[52,95],"determining":[53],"vowel":[54],"sounds":[55],"signal":[58],"even":[59],"presence":[62],"noise.":[64],"Therefore":[65],"measure":[67,88],"can":[68],"be":[69],"applicable":[70],"voice":[72],"activity":[73],"detection":[74],"vowels":[78],"characterize":[79],"Experiments":[83],"show":[84],"that":[85],"incorporating":[86],"our":[91],"recently":[92],"VAD,":[96],"will":[97],"improve":[98],"results":[100,126],"considerably":[104],"while":[105],"imposing":[106],"little":[107],"computational":[108],"overhead.":[109],"The":[110],"evaluated":[114],"datasets":[117],"various":[119],"noises":[120],"and":[121,124],"SNR":[122],"levels":[123],"satisfying":[125],"are":[127],"achieved.":[128]},"counts_by_year":[{"year":2024,"cited_by_count":1},{"year":2023,"cited_by_count":1},{"year":2022,"cited_by_count":1},{"year":2021,"cited_by_count":2},{"year":2019,"cited_by_count":4},{"year":2018,"cited_by_count":2},{"year":2017,"cited_by_count":1},{"year":2016,"cited_by_count":1},{"year":2015,"cited_by_count":2},{"year":2014,"cited_by_count":1},{"year":2013,"cited_by_count":2},{"year":2012,"cited_by_count":2}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
