{"id":"https://openalex.org/W4399341722","doi":"https://doi.org/10.1109/lsp.2024.3409212","title":"Generating Accurate and Diverse Audio Captions Through Variational Autoencoder Framework","display_name":"Generating Accurate and Diverse Audio Captions Through Variational Autoencoder Framework","publication_year":2024,"publication_date":"2024-01-01","ids":{"openalex":"https://openalex.org/W4399341722","doi":"https://doi.org/10.1109/lsp.2024.3409212"},"language":"en","primary_location":{"id":"doi:10.1109/lsp.2024.3409212","is_oa":false,"landing_page_url":"https://doi.org/10.1109/lsp.2024.3409212","pdf_url":null,"source":{"id":"https://openalex.org/S120629676","display_name":"IEEE Signal Processing Letters","issn_l":"1070-9908","issn":["1070-9908","1558-2361"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Signal Processing Letters","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://vbn.aau.dk/ws/files/796021952/Accepted_Author_Manuscript.pdf","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5103038399","display_name":"Yiming Zhang","orcid":"https://orcid.org/0000-0003-1172-6846"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yiming Zhang","raw_affiliation_strings":["Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"],"raw_orcid":"https://orcid.org/0000-0003-1172-6846","affiliations":[{"raw_affiliation_string":"Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China","institution_ids":["https://openalex.org/I139759216"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5011876517","display_name":"Ruoyi Du","orcid":"https://orcid.org/0000-0001-8372-5637"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Ruoyi Du","raw_affiliation_strings":["Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"],"raw_orcid":"https://orcid.org/0000-0001-8372-5637","affiliations":[{"raw_affiliation_string":"Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China","institution_ids":["https://openalex.org/I139759216"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5090108098","display_name":"Zheng\u2010Hua Tan","orcid":"https://orcid.org/0000-0001-6856-8928"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]},{"id":"https://openalex.org/I891191580","display_name":"Aalborg University","ror":"https://ror.org/04m5j1k67","country_code":"DK","type":"education","lineage":["https://openalex.org/I891191580"]}],"countries":["CN","DK"],"is_corresponding":false,"raw_author_name":"Zheng-Hua Tan","raw_affiliation_strings":["Department of Electronic Systems, Aalborg University, Aalborg, Denmark","Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"],"raw_orcid":"https://orcid.org/0000-0001-6856-8928","affiliations":[{"raw_affiliation_string":"Department of Electronic Systems, Aalborg University, Aalborg, Denmark","institution_ids":["https://openalex.org/I891191580"]},{"raw_affiliation_string":"Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China","institution_ids":["https://openalex.org/I139759216"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100676721","display_name":"Wenwu Wang","orcid":"https://orcid.org/0000-0002-8393-5703"},"institutions":[{"id":"https://openalex.org/I28290843","display_name":"University of Surrey","ror":"https://ror.org/00ks66431","country_code":"GB","type":"education","lineage":["https://openalex.org/I28290843"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Wenwu Wang","raw_affiliation_strings":["Centre for Vision, Speech and Signal Processing, University of Surrey, Guildford, U.K","Centre for Vision, Speech and Signal Processing, University of Surrey, Guildford, United Kingdom"],"raw_orcid":"https://orcid.org/0000-0002-8393-5703","affiliations":[{"raw_affiliation_string":"Centre for Vision, Speech and Signal Processing, University of Surrey, Guildford, U.K","institution_ids":["https://openalex.org/I28290843"]},{"raw_affiliation_string":"Centre for Vision, Speech and Signal Processing, University of Surrey, Guildford, United Kingdom","institution_ids":["https://openalex.org/I28290843"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5039812471","display_name":"Zhanyu Ma","orcid":"https://orcid.org/0000-0003-2950-2488"},"institutions":[{"id":"https://openalex.org/I139759216","display_name":"Beijing University of Posts and Telecommunications","ror":"https://ror.org/04w9fbh59","country_code":"CN","type":"education","lineage":["https://openalex.org/I139759216"]},{"id":"https://openalex.org/I891191580","display_name":"Aalborg University","ror":"https://ror.org/04m5j1k67","country_code":"DK","type":"education","lineage":["https://openalex.org/I891191580"]}],"countries":["CN","DK"],"is_corresponding":false,"raw_author_name":"Zhanyu Ma","raw_affiliation_strings":["Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China","Department of Electronic Systems, Aalborg University, Aalborg, Denmark"],"raw_orcid":"https://orcid.org/0000-0003-2950-2488","affiliations":[{"raw_affiliation_string":"Pattern Recognition and Intelligent System Laboratory, School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China","institution_ids":["https://openalex.org/I139759216"]},{"raw_affiliation_string":"Department of Electronic Systems, Aalborg University, Aalborg, Denmark","institution_ids":["https://openalex.org/I891191580"]}]}],"institutions":[],"countries_distinct_count":3,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.6515,"has_fulltext":true,"cited_by_count":3,"citation_normalized_percentile":{"value":0.63284133,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":96,"max":97},"biblio":{"volume":"31","issue":null,"first_page":"2520","last_page":"2524"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9993000030517578,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11309","display_name":"Music and Audio Processing","score":0.9993000030517578,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11439","display_name":"Video Analysis and Summarization","score":0.9943000078201294,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13310","display_name":"Subtitles and Audiovisual Media","score":0.9839000105857849,"subfield":{"id":"https://openalex.org/subfields/1203","display_name":"Language and Linguistics"},"field":{"id":"https://openalex.org/fields/12","display_name":"Arts and Humanities"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/autoencoder","display_name":"Autoencoder","score":0.9016951322555542},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6969361305236816},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.538305401802063},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5225540995597839},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.3475254774093628},{"id":"https://openalex.org/keywords/pattern-recognition","display_name":"Pattern recognition (psychology)","score":0.3436260223388672},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.17097100615501404}],"concepts":[{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.9016951322555542},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6969361305236816},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.538305401802063},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5225540995597839},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.3475254774093628},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.3436260223388672},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.17097100615501404}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1109/lsp.2024.3409212","is_oa":false,"landing_page_url":"https://doi.org/10.1109/lsp.2024.3409212","pdf_url":null,"source":{"id":"https://openalex.org/S120629676","display_name":"IEEE Signal Processing Letters","issn_l":"1070-9908","issn":["1070-9908","1558-2361"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Signal Processing Letters","raw_type":"journal-article"},{"id":"pmh:oai:pure.atira.dk:openaire/6f90c6c2-ce75-4452-a502-34933d26671e","is_oa":true,"landing_page_url":"https://vbn.aau.dk/da/publications/6f90c6c2-ce75-4452-a502-34933d26671e","pdf_url":"https://vbn.aau.dk/ws/files/796021952/Accepted_Author_Manuscript.pdf","source":{"id":"https://openalex.org/S4306401731","display_name":"VBN Forskningsportal (Aalborg Universitet)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I891191580","host_organization_name":"Aalborg University","host_organization_lineage":["https://openalex.org/I891191580"],"host_organization_lineage_names":[],"type":"repository"},"license":"other-oa","license_id":"https://openalex.org/licenses/other-oa","version":"acceptedVersion","is_accepted":true,"is_published":false,"raw_source_name":"Zhang, Y, Du, R, Tan, Z H, Wang, W & Ma, Z 2024, 'Generating Accurate and Diverse Audio Captions Through Variational Autoencoder Framework', IEEE Signal Processing Letters, vol. 31, pp. 2520-2524. https://doi.org/10.1109/LSP.2024.3409212","raw_type":"info:eu-repo/semantics/article"}],"best_oa_location":{"id":"pmh:oai:pure.atira.dk:openaire/6f90c6c2-ce75-4452-a502-34933d26671e","is_oa":true,"landing_page_url":"https://vbn.aau.dk/da/publications/6f90c6c2-ce75-4452-a502-34933d26671e","pdf_url":"https://vbn.aau.dk/ws/files/796021952/Accepted_Author_Manuscript.pdf","source":{"id":"https://openalex.org/S4306401731","display_name":"VBN Forskningsportal (Aalborg Universitet)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I891191580","host_organization_name":"Aalborg University","host_organization_lineage":["https://openalex.org/I891191580"],"host_organization_lineage_names":[],"type":"repository"},"license":"other-oa","license_id":"https://openalex.org/licenses/other-oa","version":"acceptedVersion","is_accepted":true,"is_published":false,"raw_source_name":"Zhang, Y, Du, R, Tan, Z H, Wang, W & Ma, Z 2024, 'Generating Accurate and Diverse Audio Captions Through Variational Autoencoder Framework', IEEE Signal Processing Letters, vol. 31, pp. 2520-2524. https://doi.org/10.1109/LSP.2024.3409212","raw_type":"info:eu-repo/semantics/article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G172479822","display_name":null,"funder_award_id":"62225601","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G6206703356","display_name":null,"funder_award_id":"202306470064","funder_id":"https://openalex.org/F4320322725","funder_display_name":"China Scholarship Council"},{"id":"https://openalex.org/G7697810044","display_name":null,"funder_award_id":"Z200002","funder_id":"https://openalex.org/F4320322919","funder_display_name":"Natural Science Foundation of Beijing Municipality"},{"id":"https://openalex.org/G8677236040","display_name":null,"funder_award_id":"U23B2052","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"},{"id":"https://openalex.org/F4320322725","display_name":"China Scholarship Council","ror":"https://ror.org/04atp4p48"},{"id":"https://openalex.org/F4320322919","display_name":"Natural Science Foundation of Beijing Municipality","ror":null}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4399341722.pdf","grobid_xml":"https://content.openalex.org/works/W4399341722.grobid-xml"},"referenced_works_count":26,"referenced_works":["https://openalex.org/W2964199361","https://openalex.org/W2964213897","https://openalex.org/W2982554818","https://openalex.org/W3015591594","https://openalex.org/W3094550259","https://openalex.org/W3097791920","https://openalex.org/W3135656708","https://openalex.org/W3187963534","https://openalex.org/W3205708381","https://openalex.org/W4221153784","https://openalex.org/W4224926581","https://openalex.org/W4280567182","https://openalex.org/W4297841258","https://openalex.org/W4310827337","https://openalex.org/W4372340819","https://openalex.org/W4383340360","https://openalex.org/W4385762291","https://openalex.org/W4385822505","https://openalex.org/W4387609319","https://openalex.org/W6631190155","https://openalex.org/W6640963894","https://openalex.org/W6687045409","https://openalex.org/W6744104549","https://openalex.org/W6799303324","https://openalex.org/W6799494382","https://openalex.org/W6846907506"],"related_works":["https://openalex.org/W3013693939","https://openalex.org/W2566616303","https://openalex.org/W2159052453","https://openalex.org/W3131327266","https://openalex.org/W2734887215","https://openalex.org/W2803255133","https://openalex.org/W4220775285","https://openalex.org/W2033914206","https://openalex.org/W2042327336","https://openalex.org/W3204019825"],"abstract_inverted_index":{"Generating":[0],"both":[1],"diverse":[2,38,60],"and":[3,81,112,124,154],"accurate":[4],"descriptions":[5],"is":[6,163],"an":[7,108],"essential":[8],"goal":[9],"in":[10,50],"the":[11,21,24,47,79,84,92,131,136,140,158],"audio":[12,43,61],"captioning":[13,62],"task.":[14],"Traditional":[15],"methods":[16,34],"mainly":[17],"focus":[18],"on":[19,65,100,139],"improving":[20],"accuracy":[22,82,155],"of":[23,83,121,128],"generated":[25,85],"captions":[26,39,129],"but":[27,45],"ignore":[28],"their":[29],"diversity.":[30],"In":[31,53],"contrast,":[32],"recent":[33],"have":[35],"considered":[36],"generating":[37],"for":[40],"a":[41,58,66,75,113,149],"given":[42],"clip,":[44],"with":[46],"potential":[48],"trade-off":[49,77,151],"caption":[51],"accuracy.":[52],"this":[54],"work,":[55],"we":[56],"propose":[57],"new":[59],"method":[63],"based":[64,99],"variational":[67],"autoencoder":[68],"structure,":[69],"dubbed":[70],"AC-VAE,":[71],"aiming":[72],"to":[73,157],"achieve":[74],"better":[76,150],"between":[78,152],"diversity":[80,153],"captions.":[86],"To":[87,103],"improve":[88],"diversity,":[89],"AC-VAE":[90,106,138,147],"learns":[91],"latent":[93],"word":[94,122],"distribution":[95,123],"at":[96,130,166],"each":[97],"location":[98],"contextual":[101],"information.":[102],"uphold":[104],"accuracy,":[105],"incorporates":[107],"autoregressive":[109],"prior":[110],"module":[111],"global":[114],"constraint":[115],"module,":[116],"which":[117],"enable":[118],"precise":[119],"modeling":[120],"encourage":[125],"semantic":[126],"consistency":[127],"sentence":[132],"level.":[133],"We":[134],"evaluate":[135],"proposed":[137],"Clotho":[141],"dataset.":[142],"Experimental":[143],"results":[144],"show":[145],"that":[146],"achieves":[148],"compared":[156],"state-of-the-art":[159],"methods.":[160],"The":[161],"code":[162],"publicly":[164],"available":[165],"https://github.com/XinMing0411/AC-VAE":[167]},"counts_by_year":[{"year":2025,"cited_by_count":3}],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2025-10-10T00:00:00"}
