{"id":"https://openalex.org/W7166827886","doi":"https://doi.org/10.18653/v1/2026.acl-long.832","title":"ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents","display_name":"ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166827886","doi":"https://doi.org/10.18653/v1/2026.acl-long.832"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.832","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.832","pdf_url":"https://aclanthology.org/2026.acl-long.832.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.832.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139819914","display_name":"Lei Ding","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lei Ding","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139736492","display_name":"Bin He","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bin He","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139719194","display_name":"Chenguang Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chenguang Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139815085","display_name":"Yang Janet Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang Liu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"18257","last_page":"18303"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.515999972820282,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.515999972820282,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10933","display_name":"Real-Time Systems Scheduling","score":0.14309999346733093,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13553","display_name":"Age of Information Optimization","score":0.07400000095367432,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.609000027179718},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.4717000126838684},{"id":"https://openalex.org/keywords/scheduling","display_name":"Scheduling (production processes)","score":0.4616999924182892},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.33219999074935913},{"id":"https://openalex.org/keywords/job-shop-scheduling","display_name":"Job shop scheduling","score":0.29899999499320984}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.65420001745224},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.609000027179718},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.4717000126838684},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.4616999924182892},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4113999903202057},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.33219999074935913},{"id":"https://openalex.org/C55416958","wikidata":"https://www.wikidata.org/wiki/Q6206757","display_name":"Job shop scheduling","level":3,"score":0.29899999499320984},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.2815999984741211},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.27000001072883606},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.26080000400543213}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.832","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.832","pdf_url":"https://aclanthology.org/2026.acl-long.832.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.832","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.832","pdf_url":"https://aclanthology.org/2026.acl-long.832.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166827886.pdf","grobid_xml":"https://content.openalex.org/works/W7166827886.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Proactive":[0],"task-oriented":[1],"agents":[2],"must":[3],"autonomously":[4],"anticipate":[5],"user":[6],"needs,":[7],"identify":[8],"actionable":[9],"opportunities,":[10],"and":[11,34,83,87,111,126],"trigger":[12],"software":[13],"actions":[14],"at":[15],"appropriate":[16],"moments-fundamentally":[17],"shifting":[18],"from":[19],"reactive":[20],"systems":[21],"that":[22,49,57,99,112],"await":[23],"explicit":[24],"instructions.However,":[25],"existing":[26],"approaches":[27],"lack":[28],"generalizable":[29],"end-to-end":[30],"solutions":[31],"for":[32,45,107],"measuring":[33],"optimizing":[35],"such":[36],"anticipatory":[37],"behaviors.This":[38],"paper":[39],"introduces":[40],"ProActor,":[41],"a":[42,52],"unified":[43],"framework":[44,141],"conversational":[46],"task":[47],"scheduling":[48],"integrates:":[50],"(1)":[51],"domain-agnostic":[53],"automated":[54],"annotation":[55],"methodology":[56],"enables":[58],"scalable":[59],"proactiveness":[60,77,103,113],"reinforcement":[61],"learning":[62],"(RL)":[63],"by":[64,116],"generating":[65],"full":[66],"opportunity":[67],"time":[68],"windows":[69],"instead":[70],"of":[71,156,185],"rigid":[72],"point":[73],"labels,":[74],"(2)":[75],"systematic":[76],"metrics":[78],"capturing":[79],"both":[80],"timing":[81,109,124,172],"quality":[82,125],"reference":[84,127],"action":[85,128,175],"alignment,":[86],"(3)":[88],"RL":[89,130],"optimization":[90,114],"using":[91],"GRPO":[92],"with":[93,102,146,159],"various":[94],"reward":[95,188],"designs.Our":[96],"insight":[97],"is":[98,120],"RULERbased":[100],"rewards":[101,119],"rubrics":[104],"are":[105],"crucial":[106],"improving":[108],"quality,":[110],"enabled":[115],"stageaware":[117],"composite":[118,187],"key":[121],"to":[122,178],"balancing":[123],"alignment.Timing-aware":[129],"requires":[131],"extensive":[132],"exploration,":[133],"demanding":[134],"efficient":[135],"infrastructure.We":[136],"develop":[137],"ART-F,":[138],"an":[139],"adaptive":[140],"combining":[142],"request-adaptive":[143],"inference":[144],"clusters":[145],"DDP-based":[147],"training":[148,155],"on":[149,162],"single-node":[150],"multi-GPU":[151],"systems,":[152],"enabling":[153],"LoRA":[154],"4-bit":[157],"Qwen2.5-14B-ProActor-Q4":[158],"4-8\u00d7":[160],"speedups.Experiments":[161],"two":[163],"newly":[164],"autoannotated":[165],"datasets":[166],"demonstrate":[167],"significant":[168],"improvements":[169],"in":[170],"proactive":[171],"while":[173],"maintaining":[174],"consistency":[176],"comparable":[177],"state-ofthe-art":[179],"(SOTA)":[180],"baselines.Ablations":[181],"validate":[182],"the":[183],"effectiveness":[184],"distinct":[186],"variations.Command":[189]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-07-02T00:00:00"}
