{"id":"https://openalex.org/W7155514462","doi":"https://doi.org/10.48550/arxiv.2604.21276","title":"Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition","display_name":"Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition","publication_year":2026,"publication_date":"2026-04-23","ids":{"openalex":"https://openalex.org/W7155514462","doi":"https://doi.org/10.48550/arxiv.2604.21276"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.21276","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.21276","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.21276","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5064917806","display_name":"Srishti Ginjala","orcid":"https://orcid.org/0000-0001-7269-2382"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ginjala, Srishti","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5056667180","display_name":"Eric Fosler\u2010Lussier","orcid":"https://orcid.org/0000-0001-8004-5169"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fosler-Lussier, Eric","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5102859418","display_name":"Christopher W. Myers","orcid":"https://orcid.org/0000-0003-0556-5935"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Myers, Christopher W.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5100755351","display_name":"Srinivasan Parthasarathy","orcid":"https://orcid.org/0000-0002-6062-6449"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Parthasarathy, Srinivasan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10863","display_name":"Voice and Speech Disorders","score":0.5455999970436096,"subfield":{"id":"https://openalex.org/subfields/2737","display_name":"Physiology"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}},"topics":[{"id":"https://openalex.org/T10863","display_name":"Voice and Speech Disorders","score":0.5455999970436096,"subfield":{"id":"https://openalex.org/subfields/2737","display_name":"Physiology"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}},{"id":"https://openalex.org/T10403","display_name":"Phonetics and Phonology Research","score":0.22130000591278076,"subfield":{"id":"https://openalex.org/subfields/3205","display_name":"Experimental and Cognitive Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10201","display_name":"Speech Recognition and Synthesis","score":0.07249999791383743,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/prior-probability","display_name":"Prior probability","score":0.6960999965667725},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.5963000059127808},{"id":"https://openalex.org/keywords/stress","display_name":"Stress (linguistics)","score":0.5601999759674072},{"id":"https://openalex.org/keywords/repetition","display_name":"Repetition (rhetorical device)","score":0.5432000160217285},{"id":"https://openalex.org/keywords/silence","display_name":"Silence","score":0.517799973487854},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.4772000014781952},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.4410000145435333},{"id":"https://openalex.org/keywords/encoding","display_name":"Encoding (memory)","score":0.43380001187324524},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.40310001373291016}],"concepts":[{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.7681000232696533},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7408999800682068},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.6960999965667725},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.5963000059127808},{"id":"https://openalex.org/C2776756274","wikidata":"https://www.wikidata.org/wiki/Q181767","display_name":"Stress (linguistics)","level":2,"score":0.5601999759674072},{"id":"https://openalex.org/C2776141515","wikidata":"https://www.wikidata.org/wiki/Q1274479","display_name":"Repetition (rhetorical device)","level":2,"score":0.5432000160217285},{"id":"https://openalex.org/C2781115785","wikidata":"https://www.wikidata.org/wiki/Q502261","display_name":"Silence","level":2,"score":0.517799973487854},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.4772000014781952},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.4410000145435333},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.43380001187324524},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.40310001373291016},{"id":"https://openalex.org/C177291462","wikidata":"https://www.wikidata.org/wiki/Q423038","display_name":"Active listening","level":2,"score":0.39629998803138733},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.37860000133514404},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.36320000886917114},{"id":"https://openalex.org/C13895895","wikidata":"https://www.wikidata.org/wiki/Q3270773","display_name":"Speech coding","level":2,"score":0.3628000020980835},{"id":"https://openalex.org/C57273362","wikidata":"https://www.wikidata.org/wiki/Q576722","display_name":"Decoding methods","level":2,"score":0.3578000068664551},{"id":"https://openalex.org/C2777413886","wikidata":"https://www.wikidata.org/wiki/Q3276013","display_name":"Fluency","level":2,"score":0.3547999858856201},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.35269999504089355},{"id":"https://openalex.org/C207609745","wikidata":"https://www.wikidata.org/wiki/Q4944086","display_name":"Bootstrapping (finance)","level":2,"score":0.3463999927043915},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3400999903678894},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.3305000066757202},{"id":"https://openalex.org/C155635449","wikidata":"https://www.wikidata.org/wiki/Q4674699","display_name":"Acoustic model","level":3,"score":0.3172000050544739},{"id":"https://openalex.org/C130727458","wikidata":"https://www.wikidata.org/wiki/Q1639109","display_name":"Coarticulation","level":3,"score":0.2930000126361847},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.29260000586509705},{"id":"https://openalex.org/C2780719617","wikidata":"https://www.wikidata.org/wiki/Q1030752","display_name":"Salient","level":2,"score":0.2921999990940094},{"id":"https://openalex.org/C2779231336","wikidata":"https://www.wikidata.org/wiki/Q7534724","display_name":"Sketch","level":2,"score":0.2842000126838684},{"id":"https://openalex.org/C61328038","wikidata":"https://www.wikidata.org/wiki/Q3358061","display_name":"Speech processing","level":2,"score":0.2775999903678894},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.2630000114440918},{"id":"https://openalex.org/C2778203577","wikidata":"https://www.wikidata.org/wiki/Q38035","display_name":"Consonant","level":3,"score":0.251800000667572},{"id":"https://openalex.org/C86251818","wikidata":"https://www.wikidata.org/wiki/Q816754","display_name":"Benchmarking","level":2,"score":0.25049999356269836}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.21276","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.21276","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.21276","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.21276","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Quality Education","score":0.6251883506774902,"id":"https://metadata.un.org/sdg/4"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"As":[0],"pretrained":[1,51],"large":[2],"language":[3,39],"models":[4,31],"replace":[5],"task-specific":[6],"decoders":[7,89,194],"in":[8,210],"speech":[9,111,231],"recognition,":[10],"a":[11,74,113],"critical":[12],"question":[13],"arises:":[14],"do":[15,90],"their":[16],"text-derived":[17],"priors":[18],"make":[19],"recognition":[20],"fairer":[21],"or":[22],"more":[23,127],"biased":[24],"across":[25,57,147],"demographic":[26,59],"groups?":[27],"We":[28,131],"evaluate":[29],"nine":[30],"spanning":[32],"three":[33,84],"architectural":[34],"generations":[35],"(CTC":[36],"with":[37,42,48,112,199],"no":[38],"model,":[40],"encoder-decoder":[41],"an":[43,49],"implicit":[44],"LM,":[45],"and":[46,71,121,229],"LLM-based":[47],"explicit":[50],"decoder)":[52],"on":[53,109],"about":[54],"43,000":[55],"utterances":[56],"five":[58],"axes":[60],"(ethnicity,":[61],"accent,":[62],"gender,":[63],"age,":[64],"first":[65],"language)":[66],"using":[67],"Common":[68],"Voice":[69],"24":[70],"Meta's":[72],"Fair-Speech,":[73],"controlled-prompt":[75],"dataset":[76],"that":[77,216],"eliminates":[78],"vocabulary":[79],"confounds.":[80],"On":[81],"clean":[82],"audio,":[83],"findings":[85,135],"challenge":[86],"assumptions:":[87],"LLM":[88,129,211,221],"not":[91,220],"amplify":[92],"racial":[93],"bias":[94,173],"(Granite-8B":[95],"has":[96],"the":[97,224],"best":[98],"ethnicity":[99],"fairness,":[100],"max/min":[101],"WER":[102],"=":[103],"2.28);":[104],"Whisper":[105,183],"exhibits":[106],"pathological":[107],"hallucination":[108],"Indian-accented":[110],"non-monotonic":[114],"insertion-rate":[115],"spike":[116],"to":[117,164,175],"9.62%":[118],"at":[119],"large-v3;":[120],"audio":[122,203,217],"compression":[123],"predicts":[124],"accent":[125,172],"fairness":[126,158],"than":[128],"scale.":[130],"then":[132],"stress-test":[133],"these":[134],"under":[136],"12":[137],"acoustic":[138],"degradation":[139,155],"conditions":[140],"(noise,":[141],"reverberation,":[142],"silence":[143,168],"injection,":[144],"chunk":[145],"masking)":[146],"both":[148],"datasets,":[149],"totaling":[150],"216":[151],"inference":[152],"runs.":[153],"Severe":[154],"paradoxically":[156],"compresses":[157],"gaps":[159],"as":[160],"all":[161],"groups":[162],"converge":[163],"high":[165],"WER,":[166],"but":[167],"injection":[169],"amplifies":[170],"Whisper's":[171],"up":[174],"4.64x":[176],"by":[177],"triggering":[178],"demographic-selective":[179],"hallucination.":[180],"Under":[181],"masking,":[182],"enters":[184],"catastrophic":[185],"repetition":[186,207],"loops":[187],"(86%":[188],"of":[189],"51,797":[190],"insertions)":[191],"while":[192],"explicit-LLM":[193],"produce":[195],"38x":[196],"fewer":[197],"insertions":[198],"near-zero":[200],"repetition;":[201],"high-compression":[202],"encoding":[204],"(Q-former)":[205],"reintroduces":[206],"pathology":[208],"even":[209],"decoders.":[212],"These":[213],"results":[214],"suggest":[215],"encoder":[218],"design,":[219],"scaling,":[222],"is":[223],"primary":[225],"lever":[226],"for":[227],"equitable":[228],"robust":[230],"recognition.":[232]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-25T00:00:00"}
