{"id":"https://openalex.org/W7166885558","doi":"https://doi.org/10.18653/v1/2026.acl-long.611","title":"ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents","display_name":"ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166885558","doi":"https://doi.org/10.18653/v1/2026.acl-long.611"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.611","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.611","pdf_url":"https://aclanthology.org/2026.acl-long.611.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.611.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139798201","display_name":"Tianyu Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tianyu Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5062790326","display_name":"Terry Ruas","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Terry Ruas","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139719280","display_name":"Yijun Tian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yijun Tian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139811184","display_name":"Jan Philip Wahle","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jan Philip Wahle","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5005722436","display_name":"Daniel Kurzawe","orcid":"https://orcid.org/0000-0001-5027-7313"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Daniel Kurzawe","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139801526","display_name":"Bela Gipp","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bela Gipp","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.87402915,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"13371","last_page":"13392"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.1265999972820282,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.1265999972820282,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.07660000026226044,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.07609999924898148,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.4596000015735626},{"id":"https://openalex.org/keywords/active-learning","display_name":"Active learning (machine learning)","score":0.41100001335144043},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.35249999165534973},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.34220001101493835},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.3012999892234802}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5910999774932861},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.4596000015735626},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4242999851703644},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.41100001335144043},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.35249999165534973},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.34220001101493835},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.3012999892234802},{"id":"https://openalex.org/C133462117","wikidata":"https://www.wikidata.org/wiki/Q4929239","display_name":"Data collection","level":2,"score":0.29789999127388},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.29019999504089355},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.27320000529289246}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.611","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.611","pdf_url":"https://aclanthology.org/2026.acl-long.611.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.611","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.611","pdf_url":"https://aclanthology.org/2026.acl-long.611.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G6734432001","display_name":"Digitale Geochemische DatenInfrastruktur (DIGIS) f\u00fcr GEOROC 2.0","funder_award_id":"437919684","funder_id":"https://openalex.org/F4320320879","funder_display_name":"Deutsche Forschungsgemeinschaft"}],"funders":[{"id":"https://openalex.org/F4320313139","display_name":"Nieders\u00e4chsische Ministerium f\u00fcr Wissenschaft und Kultur","ror":"https://ror.org/0116z8r77"},{"id":"https://openalex.org/F4320320879","display_name":"Deutsche Forschungsgemeinschaft","ror":"https://ror.org/018mejw64"},{"id":"https://openalex.org/F4320320882","display_name":"Volkswagen Foundation","ror":"https://ror.org/03bsmfz84"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166885558.pdf","grobid_xml":"https://content.openalex.org/works/W7166885558.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"While":[0],"Vision-language":[1],"models":[2],"(VLMs)":[3],"interpret":[4],"text-rich":[5],"images":[6],"effectively,":[7],"they":[8],"struggle":[9],"with":[10],"reasoning":[11],"across":[12],"long,":[13,36],"multi-page":[14],"documents.We":[15],"present":[16],"Active":[17],"Long-DocumEnt":[18],"Navigation":[19],"(ALDEN),":[20],"a":[21,45,71,79,90,120],"multi-turn":[22,106],"reinforcement":[23],"learning":[24],"framework":[25],"that":[26,49],"fine-tunes":[27],"VLMs":[28],"as":[29],"interactive":[30],"agents":[31],"capable":[32],"of":[33],"actively":[34],"navigating":[35],"visually":[37],"rich":[38],"documents":[39],"rather":[40],"than":[41],"passive":[42],"readers.ALDEN":[43],"features":[44],"novel":[46],"fetch":[47,109],"action":[48,58],"allows":[50],"direct":[51],"page":[52],"indexing,":[53],"complementing":[54],"the":[55],"classic":[56],"search":[57],"and":[59,67,78,101,108,123],"better":[60],"exploiting":[61],"document":[62],"structure.To":[63],"ensure":[64],"training":[65],"efficiency":[66],"stability,":[68],"we":[69],"introduce":[70],"rule-based":[72],"cross-level":[73],"reward":[74],"for":[75,126],"dense":[76],"supervision":[77],"visual-semantic":[80],"anchoring":[81],"mechanism":[82],"using":[83],"dual-path":[84],"KL-divergence":[85],"constraints.We":[86],"train":[87],"ALDEN":[88,111],"on":[89,115],"curated":[91],"corpus":[92],"built":[93],"from":[94],"open-source":[95],"datasets,":[96],"filtering":[97],"out":[98],"trivial":[99],"samples":[100],"rewriting":[102],"queries":[103],"to":[104],"incentivize":[105],"navigation":[107],"usage.Empirically,":[110],"achieves":[112],"state-of-the-art":[113],"results":[114],"five":[116],"long-document":[117,127],"benchmarks,":[118],"offering":[119],"more":[121],"accurate":[122],"efficient":[124],"path":[125],"understanding.":[128]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
