{"id":"https://openalex.org/W7165659719","doi":"https://doi.org/10.48550/arxiv.2606.22146","title":"Meta-Reinforcement Learning via Evolution for Multi-Objective Combinatorial Supply Chain Optimisation","display_name":"Meta-Reinforcement Learning via Evolution for Multi-Objective Combinatorial Supply Chain Optimisation","publication_year":2026,"publication_date":"2026-06-20","ids":{"openalex":"https://openalex.org/W7165659719","doi":"https://doi.org/10.48550/arxiv.2606.22146"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.22146","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22146","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.22146","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5116465069","display_name":"Rifny Rachman","orcid":"https://orcid.org/0000-0001-9906-1812"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Rachman, Rifny","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5028652945","display_name":"Bahrul Ilmi Nasution","orcid":"https://orcid.org/0000-0001-6526-7185"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Nasution, Bahrul Ilmi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139178189","display_name":"Josh Tingey","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tingey, Josh","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5053181919","display_name":"Richard Allmendinger","orcid":"https://orcid.org/0000-0003-1236-3143"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Allmendinger, Richard","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128617221","display_name":"Pradyumn Shukla","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shukla, Pradyumn","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139147228","display_name":"Wei Pan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pan, Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10848","display_name":"Advanced Multi-Objective Optimization Algorithms","score":0.9638000130653381,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10848","display_name":"Advanced Multi-Objective Optimization Algorithms","score":0.9638000130653381,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10100","display_name":"Metaheuristic Optimization Algorithms Research","score":0.006200000178068876,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.0031999999191612005,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.722100019454956},{"id":"https://openalex.org/keywords/generality","display_name":"Generality","score":0.6040999889373779},{"id":"https://openalex.org/keywords/population","display_name":"Population","score":0.5867000222206116},{"id":"https://openalex.org/keywords/pareto-principle","display_name":"Pareto principle","score":0.474700003862381},{"id":"https://openalex.org/keywords/multi-objective-optimization","display_name":"Multi-objective optimization","score":0.4523000121116638},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.4372999966144562},{"id":"https://openalex.org/keywords/evolutionary-algorithm","display_name":"Evolutionary algorithm","score":0.4246000051498413},{"id":"https://openalex.org/keywords/supply-chain","display_name":"Supply chain","score":0.3928000032901764}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.722100019454956},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.6481000185012817},{"id":"https://openalex.org/C2780767217","wikidata":"https://www.wikidata.org/wiki/Q5532421","display_name":"Generality","level":2,"score":0.6040999889373779},{"id":"https://openalex.org/C2908647359","wikidata":"https://www.wikidata.org/wiki/Q2625603","display_name":"Population","level":2,"score":0.5867000222206116},{"id":"https://openalex.org/C137635306","wikidata":"https://www.wikidata.org/wiki/Q182667","display_name":"Pareto principle","level":2,"score":0.474700003862381},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.47029998898506165},{"id":"https://openalex.org/C68781425","wikidata":"https://www.wikidata.org/wiki/Q2052203","display_name":"Multi-objective optimization","level":2,"score":0.4523000121116638},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.4372999966144562},{"id":"https://openalex.org/C159149176","wikidata":"https://www.wikidata.org/wiki/Q14489129","display_name":"Evolutionary algorithm","level":2,"score":0.4246000051498413},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.4018999934196472},{"id":"https://openalex.org/C108713360","wikidata":"https://www.wikidata.org/wiki/Q1824206","display_name":"Supply chain","level":2,"score":0.3928000032901764},{"id":"https://openalex.org/C151201525","wikidata":"https://www.wikidata.org/wiki/Q177239","display_name":"Limit (mathematics)","level":2,"score":0.3912000060081482},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.38989999890327454},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.3398999869823456},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.32330000400543213},{"id":"https://openalex.org/C501734568","wikidata":"https://www.wikidata.org/wiki/Q42918","display_name":"Mutation","level":3,"score":0.3172000050544739},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.31459999084472656},{"id":"https://openalex.org/C124681953","wikidata":"https://www.wikidata.org/wiki/Q339062","display_name":"Decomposition","level":2,"score":0.30480000376701355},{"id":"https://openalex.org/C8880873","wikidata":"https://www.wikidata.org/wiki/Q187787","display_name":"Genetic algorithm","level":2,"score":0.29089999198913574},{"id":"https://openalex.org/C105902424","wikidata":"https://www.wikidata.org/wiki/Q1197129","display_name":"Evolutionary computation","level":2,"score":0.2732999920845032},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.25440001487731934}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.22146","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22146","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.22146","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.22146","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Life in Land","id":"https://metadata.un.org/sdg/15","score":0.427267849445343}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Meta-reinforcement":[0,58],"learning":[1,59,131,160],"is":[2],"a":[3,28,56,74,82,111],"promising":[4],"approach":[5,139],"to":[6,155],"multi-objective":[7,112],"optimisation":[8],"because":[9],"it":[10],"enables":[11],"rapid":[12],"policy":[13],"adaptation":[14],"across":[15],"changing":[16],"environments":[17],"and":[18,37,89,98,103,120,123,165],"preference":[19],"settings.":[20],"However,":[21],"conventional":[22],"few-shot":[23],"methods":[24],"usually":[25],"fine-tune":[26],"from":[27],"single":[29],"shared":[30],"meta-policy,":[31],"which":[32],"can":[33],"reduce":[34],"solution":[35],"diversity":[36],"limit":[38],"exploration":[39],"of":[40,76],"the":[41,108,137,162,167],"Pareto":[42,145],"front,":[43],"especially":[44],"in":[45,67,110,161],"high-dimensional":[46],"combinatorial":[47],"problems":[48],"such":[49],"as":[50],"supply":[51,113],"chain":[52,114],"optimisation.":[53],"We":[54,106],"propose":[55],"population-based":[57],"framework":[60,72],"that":[61,136],"combines":[62],"decomposition":[63],"with":[64,81,116],"evolutionary":[65],"search":[66],"scalarisation":[68],"weight":[69,77],"space.":[70],"The":[71,133],"maintains":[73],"population":[75,93],"vectors,":[78],"each":[79],"associated":[80],"distinct":[83],"meta-policy":[84],"trained":[85],"through":[86,94],"gradient-based":[87],"meta-learning,":[88],"iteratively":[90],"refines":[91],"this":[92],"elitist":[95],"selection,":[96],"crossover,":[97],"mutation":[99],"guided":[100],"by":[101,153],"hypervolume":[102,152],"entropy":[104],"contributions.":[105],"evaluate":[107],"method":[109],"setting":[115],"conflicting":[117],"economic,":[118],"environmental,":[119],"social":[121],"goals,":[122],"further":[124],"test":[125],"its":[126],"generality":[127],"on":[128],"standard":[129],"reinforcement":[130,159],"problems.":[132],"results":[134],"show":[135],"proposed":[138],"yields":[140],"more":[141],"diverse,":[142],"better":[143],"distributed":[144],"front":[146],"approximations,":[147],"improves":[148],"cross-task":[149],"adaptation,":[150],"increases":[151],"up":[154],"32\\%":[156],"over":[157],"Meta-multi-objective":[158],"complex":[163],"case,":[164],"attains":[166],"lowest":[168],"average":[169],"Hausdorff":[170],"distance":[171],"among":[172],"all":[173],"compared":[174],"methods.":[175]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-24T00:00:00"}
