{"id":"https://openalex.org/W4414231059","doi":"https://doi.org/10.1109/ialp68296.2024.11156314","title":"Speech-to-Tree: Cultivating Dependency Structures from Spoken English","display_name":"Speech-to-Tree: Cultivating Dependency Structures from Spoken English","publication_year":2025,"publication_date":"2025-08-03","ids":{"openalex":"https://openalex.org/W4414231059","doi":"https://doi.org/10.1109/ialp68296.2024.11156314"},"language":"en","primary_location":{"id":"doi:10.1109/ialp68296.2024.11156314","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ialp68296.2024.11156314","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Conference on Asian Language Processing (IALP)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5048063417","display_name":"Manish Prajapati","orcid":"https://orcid.org/0000-0002-5356-9271"},"institutions":[{"id":"https://openalex.org/I98389781","display_name":"Dhirubhai Ambani University","ror":"https://ror.org/02d5b7g69","country_code":"IN","type":"education","lineage":["https://openalex.org/I98389781"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Manish M. Prajapati","raw_affiliation_strings":["Dhirubhai Ambani University,Speech Research Lab,Gandhinagar,India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Dhirubhai Ambani University,Speech Research Lab,Gandhinagar,India","institution_ids":["https://openalex.org/I98389781"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5043002276","display_name":"Hemant A. Patil","orcid":"https://orcid.org/0000-0002-4068-2005"},"institutions":[{"id":"https://openalex.org/I98389781","display_name":"Dhirubhai Ambani University","ror":"https://ror.org/02d5b7g69","country_code":"IN","type":"education","lineage":["https://openalex.org/I98389781"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Hemant A. Patil","raw_affiliation_strings":["Dhirubhai Ambani University,Speech Research Lab,Gandhinagar,India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Dhirubhai Ambani University,Speech Research Lab,Gandhinagar,India","institution_ids":["https://openalex.org/I98389781"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I98389781"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.20433824,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"79","last_page":"84"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.6169999837875366,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.6169999837875366,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/spoken-language","display_name":"Spoken language","score":0.6366999745368958},{"id":"https://openalex.org/keywords/transcription","display_name":"Transcription (linguistics)","score":0.5421000123023987},{"id":"https://openalex.org/keywords/dependency","display_name":"Dependency (UML)","score":0.5231000185012817},{"id":"https://openalex.org/keywords/parsing","display_name":"Parsing","score":0.5055999755859375},{"id":"https://openalex.org/keywords/prosody","display_name":"Prosody","score":0.4869999885559082},{"id":"https://openalex.org/keywords/syntax","display_name":"Syntax","score":0.48570001125335693},{"id":"https://openalex.org/keywords/natural-language","display_name":"Natural language","score":0.453900009393692},{"id":"https://openalex.org/keywords/dependency-grammar","display_name":"Dependency grammar","score":0.43160000443458557}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8312000036239624},{"id":"https://openalex.org/C2776230583","wikidata":"https://www.wikidata.org/wiki/Q1322198","display_name":"Spoken language","level":2,"score":0.6366999745368958},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.5756999850273132},{"id":"https://openalex.org/C179926584","wikidata":"https://www.wikidata.org/wiki/Q207714","display_name":"Transcription (linguistics)","level":2,"score":0.5421000123023987},{"id":"https://openalex.org/C19768560","wikidata":"https://www.wikidata.org/wiki/Q320727","display_name":"Dependency (UML)","level":2,"score":0.5231000185012817},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5113000273704529},{"id":"https://openalex.org/C186644900","wikidata":"https://www.wikidata.org/wiki/Q194152","display_name":"Parsing","level":2,"score":0.5055999755859375},{"id":"https://openalex.org/C542774811","wikidata":"https://www.wikidata.org/wiki/Q10880526","display_name":"Prosody","level":2,"score":0.4869999885559082},{"id":"https://openalex.org/C60048249","wikidata":"https://www.wikidata.org/wiki/Q37437","display_name":"Syntax","level":2,"score":0.48570001125335693},{"id":"https://openalex.org/C195324797","wikidata":"https://www.wikidata.org/wiki/Q33742","display_name":"Natural language","level":2,"score":0.453900009393692},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.45320001244544983},{"id":"https://openalex.org/C164883195","wikidata":"https://www.wikidata.org/wiki/Q674834","display_name":"Dependency grammar","level":3,"score":0.43160000443458557},{"id":"https://openalex.org/C53893814","wikidata":"https://www.wikidata.org/wiki/Q7378909","display_name":"Rule-based machine translation","level":2,"score":0.3928999900817871},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.35420000553131104},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.31619998812675476},{"id":"https://openalex.org/C163765913","wikidata":"https://www.wikidata.org/wiki/Q1006348","display_name":"Indirect speech","level":2,"score":0.31520000100135803},{"id":"https://openalex.org/C51764019","wikidata":"https://www.wikidata.org/wiki/Q283987","display_name":"Direct speech","level":2,"score":0.311599999666214},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.303600013256073},{"id":"https://openalex.org/C60048801","wikidata":"https://www.wikidata.org/wiki/Q1433889","display_name":"Intelligibility (philosophy)","level":2,"score":0.3025999963283539},{"id":"https://openalex.org/C2779439875","wikidata":"https://www.wikidata.org/wiki/Q1078276","display_name":"Natural language understanding","level":3,"score":0.2980000078678131},{"id":"https://openalex.org/C14999030","wikidata":"https://www.wikidata.org/wiki/Q16346","display_name":"Speech synthesis","level":2,"score":0.2906999886035919},{"id":"https://openalex.org/C197129107","wikidata":"https://www.wikidata.org/wiki/Q1921621","display_name":"Merge (version control)","level":2,"score":0.2897999882698059},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.2858999967575073},{"id":"https://openalex.org/C189645446","wikidata":"https://www.wikidata.org/wiki/Q350865","display_name":"Mirroring","level":2,"score":0.2793000042438507},{"id":"https://openalex.org/C2780366754","wikidata":"https://www.wikidata.org/wiki/Q7494857","display_name":"Speech translation","level":3,"score":0.2621000111103058}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ialp68296.2024.11156314","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ialp68296.2024.11156314","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Conference on Asian Language Processing (IALP)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":10,"referenced_works":["https://openalex.org/W1494198834","https://openalex.org/W1559303682","https://openalex.org/W2052449326","https://openalex.org/W2116410915","https://openalex.org/W2143827132","https://openalex.org/W2166451556","https://openalex.org/W2740840489","https://openalex.org/W4301881503","https://openalex.org/W4399837588","https://openalex.org/W4402112030"],"related_works":[],"abstract_inverted_index":{"Dependency":[0],"parsing":[1,73],"has":[2],"long":[3],"been":[4],"a":[5,38,167,176,226,239],"cornerstone":[6],"of":[7,19,77,93,149,170,193],"natural":[8,219],"language":[9,223],"understanding,":[10,224],"allowing":[11],"machines":[12,231],"to":[13,29,34,71,89,145,206],"dissect":[14],"and":[15,75,83,133,154,172,220,253],"learn":[16],"syntactic":[17,129,210],"structures":[18],"sentences.":[20],"However,":[21],"traditional":[22],"methods":[23],"face":[24],"certain":[25],"limitations":[26],"when":[27],"applied":[28],"spoken":[30,94,222,248],"language,":[31,114],"mainly":[32],"due":[33],"their":[35],"reliance":[36],"on":[37,229],"two-step":[39],"process:":[40],"first,":[41],"they":[42,53],"transcribe":[43],"speech":[44,127,205,236],"into":[45],"text":[46],"using":[47],"Automatic":[48],"Speech":[49],"Recognition":[50],"(ASR),":[51],"then,":[52],"parse":[54],"the":[55,91,112,116,143,147,183,191,199,215],"resulting":[56],"text.":[57],"This":[58,85,139,187],"pipeline":[59],"introduces":[60],"potential":[61,244],"ASR":[62,185],"errors,":[63],"particularly":[64],"in":[65,160,204,238,246],"noisy":[66],"or":[67],"resource-scare":[68],"environments,":[69],"leading":[70],"degraded":[72],"accuracy":[74],"loss":[76],"prosodic":[78,132],"information,":[79,174],"such":[80,151],"as":[81,152],"intonation":[82],"stress.":[84],"information":[86,202],"is":[87],"critical":[88],"understanding":[90],"syntax":[92],"language.":[95],"Our":[96,123,163,212],"work":[97,213],"addresses":[98],"these":[99],"challenges":[100],"by":[101],"pioneering":[102],"an":[103,119],"end-to-end":[104],"approach":[105],"that":[106],"directly":[107],"generates":[108],"dependency":[109],"trees":[110],"from":[111],"English":[113],"eliminating":[115],"need":[117],"for":[118,217],"intermediate":[120],"transcription":[121,194],"step.":[122],"proposed":[124,164],"method":[125],"aligns":[126],"with":[128,243],"structures,":[130],"preserving":[131],"acoustic":[134],"cues,":[135],"which":[136,156,181],"improves":[137],"parsing.":[138,162],"multi-modal":[140],"strategy":[141],"allows":[142],"model":[144],"capture":[146],"nuances":[148],"speech,":[150],"silence":[153],"emphasis,":[155],"are":[157],"not":[158,188],"present":[159],"text-based":[161],"approaches":[165],"ensure":[166],"seamless":[168],"fusion":[169],"auditory":[171],"linguistic":[173],"enabling":[175],"direct":[177],"speech-to-tree":[178],"(S2T)":[179],"mapping,":[180],"eliminates":[182],"error-prone":[184],"bottleneck.":[186],"only":[189],"mitigates":[190],"impact":[192],"inaccuracies,":[195],"but":[196],"also":[197],"leverages":[198],"rich":[200],"contextual":[201],"embedded":[203,234],"produce":[207],"more":[208,218],"accurate":[209],"representations.":[211],"paves":[214],"way":[216],"effective":[221],"offering":[225],"transformative":[227],"perspective":[228],"how":[230],"can":[232],"interpret":[233],"human":[235],"structure":[237],"single,":[240],"unified":[241],"step,":[242],"applications":[245],"real-time":[247],"dialogue":[249],"systems,":[250],"accessibility":[251],"tools,":[252],"beyond.":[254]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
