{"id":"https://openalex.org/W7169773497","doi":"https://doi.org/10.1145/3788550.3794864","title":"Balancing Multiple Objectives in Urban Traffic Control with Reinforcement Learning from AI Feedback","display_name":"Balancing Multiple Objectives in Urban Traffic Control with Reinforcement Learning from AI Feedback","publication_year":2026,"publication_date":"2026-04-13","ids":{"openalex":"https://openalex.org/W7169773497","doi":"https://doi.org/10.1145/3788550.3794864"},"language":null,"primary_location":{"id":"doi:10.1145/3788550.3794864","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3788550.3794864","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.1145/3788550.3794864","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Chenyang Zhao","orcid":"https://orcid.org/0000-0002-3739-8409"},"institutions":[{"id":"https://openalex.org/I205274468","display_name":"Trinity College Dublin","ror":"https://ror.org/02tyrky19","country_code":"IE","type":"education","lineage":["https://openalex.org/I205274468"]}],"countries":["IE"],"is_corresponding":false,"raw_author_name":"Chenyang Zhao","raw_affiliation_strings":["School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland"],"raw_orcid":"https://orcid.org/0000-0002-3739-8409","affiliations":[{"raw_affiliation_string":"School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland","institution_ids":["https://openalex.org/I205274468"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Vinny Cahill","orcid":"https://orcid.org/0000-0002-0822-3490"},"institutions":[{"id":"https://openalex.org/I205274468","display_name":"Trinity College Dublin","ror":"https://ror.org/02tyrky19","country_code":"IE","type":"education","lineage":["https://openalex.org/I205274468"]}],"countries":["IE"],"is_corresponding":false,"raw_author_name":"Vinny Cahill","raw_affiliation_strings":["School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland"],"raw_orcid":"https://orcid.org/0000-0002-0822-3490","affiliations":[{"raw_affiliation_string":"School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland","institution_ids":["https://openalex.org/I205274468"]}]},{"author_position":"last","author":{"id":null,"display_name":"Ivana Dusparic","orcid":"https://orcid.org/0000-0003-0621-5400"},"institutions":[{"id":"https://openalex.org/I205274468","display_name":"Trinity College Dublin","ror":"https://ror.org/02tyrky19","country_code":"IE","type":"education","lineage":["https://openalex.org/I205274468"]}],"countries":["IE"],"is_corresponding":false,"raw_author_name":"Ivana Dusparic","raw_affiliation_strings":["School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland"],"raw_orcid":"https://orcid.org/0000-0003-0621-5400","affiliations":[{"raw_affiliation_string":"School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland","institution_ids":["https://openalex.org/I205274468"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I205274468"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"30","last_page":"35"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":null,"topics":[],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8270000219345093},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.5547000169754028},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.5059999823570251},{"id":"https://openalex.org/keywords/preference","display_name":"Preference","score":0.44609999656677246},{"id":"https://openalex.org/keywords/preference-learning","display_name":"Preference learning","score":0.4334999918937683},{"id":"https://openalex.org/keywords/extension","display_name":"Extension (predicate logic)","score":0.3986999988555908},{"id":"https://openalex.org/keywords/path","display_name":"Path (computing)","score":0.3707999885082245}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8270000219345093},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.713100016117096},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.5547000169754028},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.5059999823570251},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4472000002861023},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.44609999656677246},{"id":"https://openalex.org/C181204326","wikidata":"https://www.wikidata.org/wiki/Q7239820","display_name":"Preference learning","level":3,"score":0.4334999918937683},{"id":"https://openalex.org/C2778029271","wikidata":"https://www.wikidata.org/wiki/Q5421931","display_name":"Extension (predicate logic)","level":2,"score":0.3986999988555908},{"id":"https://openalex.org/C2777735758","wikidata":"https://www.wikidata.org/wiki/Q817765","display_name":"Path (computing)","level":2,"score":0.3707999885082245},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3569999933242798},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.3433000147342682},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.31459999084472656},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.28529998660087585},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.2791999876499176},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.2637999951839447},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.26010000705718994},{"id":"https://openalex.org/C117035363","wikidata":"https://www.wikidata.org/wiki/Q3769299","display_name":"Human behavior","level":2,"score":0.2531999945640564},{"id":"https://openalex.org/C47932503","wikidata":"https://www.wikidata.org/wiki/Q5395689","display_name":"Error-driven learning","level":3,"score":0.25060001015663147}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3788550.3794864","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3788550.3794864","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.1145/3788550.3794864","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3788550.3794864","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":13,"referenced_works":["https://openalex.org/W2013784666","https://openalex.org/W2964749398","https://openalex.org/W3107153805","https://openalex.org/W3123082711","https://openalex.org/W4384786224","https://openalex.org/W4391908212","https://openalex.org/W4391939531","https://openalex.org/W4399431377","https://openalex.org/W4403280560","https://openalex.org/W4406415458","https://openalex.org/W4412444832","https://openalex.org/W4413925998","https://openalex.org/W7133188558"],"related_works":[],"abstract_inverted_index":{"Reward":[0],"design":[1],"has":[2,45],"been":[3],"one":[4],"of":[5,35,78,115],"the":[6,59,75,113,116],"central":[7],"challenges":[8],"for":[9,104],"real":[10],"world":[11],"reinforcement":[12],"learning":[13,29,158],"(RL)":[14],"deployment,":[15],"especially":[16],"in":[17,159],"settings":[18],"with":[19,161],"multiple":[20,85],"objectives.":[21,86,164],"Preference-based":[22],"RL":[23,40,150],"offers":[24,151],"an":[25],"appealing":[26],"alternative":[27],"by":[28],"from":[30,41],"human":[31,62],"preferences":[32],"over":[33],"pairs":[34],"behavioural":[36],"outcomes.":[37],"More":[38],"recently,":[39],"AI":[42],"feedback":[43],"(RLAIF)":[44],"demonstrated":[46],"that":[47,83,125,131,145],"large":[48],"language":[49],"models":[50],"(LLMs)":[51],"can":[52,128],"generate":[53],"preference":[54],"labels":[55],"at":[56],"scale,":[57],"mitigating":[58],"reliance":[60],"on":[61,71],"annotators.":[63],"However,":[64],"existing":[65],"RLAIF":[66,80,117,127,147],"work":[67],"typically":[68],"focuses":[69],"only":[70],"single-objective":[72],"tasks,":[73],"leaving":[74],"open":[76],"question":[77],"how":[79],"handles":[81],"systems":[82,89],"involve":[84],"In":[87,108],"such":[88],"trade-offs":[90,134],"among":[91],"conflicting":[92,163],"objectives":[93],"are":[94],"difficult":[95],"to":[96,119],"specify,":[97],"and":[98],"policies":[99,130],"risk":[100],"collapsing":[101],"into":[102,148],"optimizing":[103],"a":[105,152],"dominant":[106],"goal.":[107],"this":[109],"paper,":[110],"we":[111],"explore":[112],"extension":[114],"paradigm":[118],"multi-objective":[120,126,149],"self-adaptive":[121],"systems.":[122],"We":[123,143],"show":[124],"produce":[129],"yield":[132],"balanced":[133],"reflecting":[135],"different":[136],"user":[137],"priorities":[138],"without":[139],"laborious":[140],"reward":[141],"engineering.":[142],"argue":[144],"integrating":[146],"scalable":[153],"path":[154],"toward":[155],"user-aligned":[156],"policy":[157],"domains":[160],"inherently":[162]},"counts_by_year":[],"updated_date":"2026-07-21T08:15:58.654021","created_date":"2026-03-01T00:00:00"}
