{"id":"https://openalex.org/W4409537061","doi":"https://doi.org/10.1109/icvisp64524.2024.10959349","title":"The Comparison of Different Deep Learning Models for Chinese Musical Instrument Recognition","display_name":"The Comparison of Different Deep Learning Models for Chinese Musical Instrument Recognition","publication_year":2024,"publication_date":"2024-12-27","ids":{"openalex":"https://openalex.org/W4409537061","doi":"https://doi.org/10.1109/icvisp64524.2024.10959349"},"language":"en","primary_location":{"id":"doi:10.1109/icvisp64524.2024.10959349","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icvisp64524.2024.10959349","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 IEEE 8th International Conference on Vision, Image and Signal Processing (ICVISP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Rongan Jin","orcid":null},"institutions":[{"id":"https://openalex.org/I120825670","display_name":"Yunnan Normal University","ror":"https://ror.org/00sc9n023","country_code":"CN","type":"education","lineage":["https://openalex.org/I120825670"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Rongan Jin","raw_affiliation_strings":["School of Information, Yunnan Normal University,Kunming,China,650500"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Information, Yunnan Normal University,Kunming,China,650500","institution_ids":["https://openalex.org/I120825670"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5005083930","display_name":"Yi Zhou","orcid":"https://orcid.org/0000-0001-7445-226X"},"institutions":[{"id":"https://openalex.org/I120825670","display_name":"Yunnan Normal University","ror":"https://ror.org/00sc9n023","country_code":"CN","type":"education","lineage":["https://openalex.org/I120825670"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yi Zhou","raw_affiliation_strings":["School of Information, Yunnan Normal University,Kunming,China,650500"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Information, Yunnan Normal University,Kunming,China,650500","institution_ids":["https://openalex.org/I120825670"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5113938372","display_name":"Hui Wu","orcid":null},"institutions":[{"id":"https://openalex.org/I120825670","display_name":"Yunnan Normal University","ror":"https://ror.org/00sc9n023","country_code":"CN","type":"education","lineage":["https://openalex.org/I120825670"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Hui Wu","raw_affiliation_strings":["School of Information, Yunnan Normal University,Kunming,China,650500"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Information, Yunnan Normal University,Kunming,China,650500","institution_ids":["https://openalex.org/I120825670"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I120825670"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.38213044,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9961000084877014,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9961000084877014,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13996","display_name":"Diverse Musicological Studies","score":0.9714999794960022,"subfield":{"id":"https://openalex.org/subfields/1210","display_name":"Music"},"field":{"id":"https://openalex.org/fields/12","display_name":"Arts and Humanities"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11349","display_name":"Music Technology and Sound Studies","score":0.9307000041007996,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/musical-instrument","display_name":"Musical instrument","score":0.6911890506744385},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6496094465255737},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.46041661500930786},{"id":"https://openalex.org/keywords/musical","display_name":"Musical","score":0.459859162569046},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4432297348976135},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.4340732991695404},{"id":"https://openalex.org/keywords/acoustics","display_name":"Acoustics","score":0.13179072737693787},{"id":"https://openalex.org/keywords/visual-arts","display_name":"Visual arts","score":0.10339820384979248},{"id":"https://openalex.org/keywords/art","display_name":"Art","score":0.08166554570198059}],"concepts":[{"id":"https://openalex.org/C2983311337","wikidata":"https://www.wikidata.org/wiki/Q34379","display_name":"Musical instrument","level":2,"score":0.6911890506744385},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6496094465255737},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.46041661500930786},{"id":"https://openalex.org/C558565934","wikidata":"https://www.wikidata.org/wiki/Q2743","display_name":"Musical","level":2,"score":0.459859162569046},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4432297348976135},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.4340732991695404},{"id":"https://openalex.org/C24890656","wikidata":"https://www.wikidata.org/wiki/Q82811","display_name":"Acoustics","level":1,"score":0.13179072737693787},{"id":"https://openalex.org/C153349607","wikidata":"https://www.wikidata.org/wiki/Q36649","display_name":"Visual arts","level":1,"score":0.10339820384979248},{"id":"https://openalex.org/C142362112","wikidata":"https://www.wikidata.org/wiki/Q735","display_name":"Art","level":0,"score":0.08166554570198059},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icvisp64524.2024.10959349","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icvisp64524.2024.10959349","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 IEEE 8th International Conference on Vision, Image and Signal Processing (ICVISP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":14,"referenced_works":["https://openalex.org/W2112796928","https://openalex.org/W2117671523","https://openalex.org/W2147800946","https://openalex.org/W2148154194","https://openalex.org/W2157331557","https://openalex.org/W2194775991","https://openalex.org/W2752782242","https://openalex.org/W2918261709","https://openalex.org/W2955236589","https://openalex.org/W2996287636","https://openalex.org/W3024869864","https://openalex.org/W3134095852","https://openalex.org/W4382562069","https://openalex.org/W6696085341"],"related_works":["https://openalex.org/W2731899572","https://openalex.org/W3215138031","https://openalex.org/W3009238340","https://openalex.org/W4360585206","https://openalex.org/W4321369474","https://openalex.org/W4285208911","https://openalex.org/W3082895349","https://openalex.org/W4213079790","https://openalex.org/W2248239756","https://openalex.org/W3086377361"],"abstract_inverted_index":{"Instrument":[0],"recognition":[1,28,57,135,163],"plays":[2],"a":[3,105],"crucial":[4],"role":[5],"in":[6,26,160],"various":[7],"domains":[8],"such":[9],"as":[10,71],"music,":[11],"education,":[12],"artificial":[13],"intelligence,":[14],"and":[15,68,91,101,119,146,158,196],"cultural":[16],"preservation.":[17],"While":[18],"deep":[19,52,63,147],"learning":[20,53,64],"technologies":[21],"have":[22],"achieved":[23,182],"significant":[24,125],"success":[25],"the":[27,49,56,75,87,129,138,154,176,183,204],"of":[29,51,58,81,108,156,162],"Western":[30],"musical":[31,37,110],"instruments,":[32,85],"their":[33],"application":[34],"to":[35,123],"Chinese":[36,60,84,109,133,213],"instruments":[38],"remains":[39],"relatively":[40],"unexplored.":[41],"To":[42],"bridge":[43],"this":[44,46],"gap,":[45],"study":[47,151],"investigates":[48],"use":[50],"techniques":[54],"for":[55,74,211],"traditional":[59,83],"instruments.":[61,111,214],"Four":[62],"models\u2014RNN,":[65],"ResNetSE,":[66],"TDNN,":[67],"ECAPA-TDNN\u2014were":[69],"chosen":[70],"experimental":[72],"models":[73,177],"task.":[76],"A":[77],"diverse":[78],"dataset":[79,96],"consisting":[80],"37":[82],"including":[86],"Erhu,":[88],"Pipa,":[89],"Guzheng,":[90],"Dizi,":[92],"was":[93],"created.":[94],"The":[95,132,150],"incorporates":[97],"different":[98],"tones,":[99],"timbres,":[100],"playing":[102],"speeds,":[103],"ensuring":[104],"comprehensive":[106],"representation":[107],"For":[112],"feature":[113,144,172],"extraction,":[114,145],"Mel-frequency":[115],"cepstral":[116],"coefficients":[117],"(MFCC)":[118],"spectrograms":[120,159],"were":[121],"employed":[122],"capture":[124],"audio":[126,139],"features":[127],"from":[128],"instrument":[130,134],"sounds.":[131],"system":[136],"processes":[137],"through":[140],"three":[141],"stages:":[142],"preprocessing,":[143],"learning-based":[148],"classification.":[149],"further":[152],"compares":[153],"performance":[155],"MFCC":[157,169,179],"terms":[161],"accuracy.":[164],"Experimental":[165],"results":[166],"demonstrate":[167],"that":[168,203],"provides":[170],"superior":[171],"extraction":[173],"results.":[174],"Among":[175],"using":[178],"features,":[180],"ECAPA-TDNN":[181],"highest":[184],"accuracy":[185],"at":[186,191,194,198],"97.18%,":[187],"followed":[188],"by":[189],"TDNN":[190],"96.02%,":[192],"ResNetSE":[193],"95.01%,":[195],"RNN":[197],"92.59%.":[199],"These":[200],"findings":[201],"suggest":[202],"TDNN-based":[205],"neural":[206],"networks":[207],"are":[208],"particularly":[209],"effective":[210],"recognizing":[212]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
