{"id":"https://openalex.org/W7147745577","doi":"https://doi.org/10.48550/arxiv.2603.27066","title":"Dynamic resource matching in manufacturing using deep reinforcement learning","display_name":"Dynamic resource matching in manufacturing using deep reinforcement learning","publication_year":2026,"publication_date":"2026-03-28","ids":{"openalex":"https://openalex.org/W7147745577","doi":"https://doi.org/10.48550/arxiv.2603.27066"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.27066","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.27066","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.27066","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Panda, Saunak Kumar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Panda, Saunak Kumar","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Xiang, Yisha","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiang, Yisha","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"Liu, Ruiqi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Ruiqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5611000061035156,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5611000061035156,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10551","display_name":"Scheduling and Optimization Algorithms","score":0.13339999318122864,"subfield":{"id":"https://openalex.org/subfields/2209","display_name":"Industrial and Manufacturing Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.055399999022483826,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7646999955177307},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.6664000153541565},{"id":"https://openalex.org/keywords/curse-of-dimensionality","display_name":"Curse of dimensionality","score":0.6500999927520752},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.5605000257492065},{"id":"https://openalex.org/keywords/domain","display_name":"Domain (mathematical analysis)","score":0.510200023651123},{"id":"https://openalex.org/keywords/range","display_name":"Range (aeronautics)","score":0.48249998688697815},{"id":"https://openalex.org/keywords/operator","display_name":"Operator (biology)","score":0.39800000190734863}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7646999955177307},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.6664000153541565},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6535000205039978},{"id":"https://openalex.org/C111030470","wikidata":"https://www.wikidata.org/wiki/Q1430460","display_name":"Curse of dimensionality","level":2,"score":0.6500999927520752},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.5605000257492065},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5568000078201294},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.510200023651123},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.48249998688697815},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.42669999599456787},{"id":"https://openalex.org/C17020691","wikidata":"https://www.wikidata.org/wiki/Q139677","display_name":"Operator (biology)","level":5,"score":0.39800000190734863},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.3506999909877777},{"id":"https://openalex.org/C29202148","wikidata":"https://www.wikidata.org/wiki/Q287260","display_name":"Resource allocation","level":2,"score":0.3418999910354614},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.33980000019073486},{"id":"https://openalex.org/C123853557","wikidata":"https://www.wikidata.org/wiki/Q7098946","display_name":"Optimal matching","level":3,"score":0.30820000171661377},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.3043000102043152},{"id":"https://openalex.org/C207685749","wikidata":"https://www.wikidata.org/wiki/Q2088941","display_name":"Domain knowledge","level":2,"score":0.2946000099182129},{"id":"https://openalex.org/C2778348673","wikidata":"https://www.wikidata.org/wiki/Q739302","display_name":"Production (economics)","level":2,"score":0.2637999951839447},{"id":"https://openalex.org/C2780609101","wikidata":"https://www.wikidata.org/wiki/Q17156588","display_name":"Resource management (computing)","level":2,"score":0.2596000134944916}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.27066","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.27066","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.27066","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.27066","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Matching":[0],"plays":[1],"an":[2,162],"important":[3],"role":[4],"in":[5,25,141,240],"the":[6,42,54,84,94,99,104,123,138,148,168,176,199],"logical":[7],"allocation":[8],"of":[9,15,19,44,49,87,90,96,101,125,178],"resources":[10],"across":[11],"a":[12,61,109,152,158],"wide":[13],"range":[14],"industries.":[16,27],"The":[17,65],"benefits":[18],"matching":[20,46,118],"have":[21],"been":[22],"increasingly":[23],"recognized":[24],"manufacturing":[26,50,57,67],"In":[28,37,215],"particular,":[29],"capacity":[30],"sharing":[31],"has":[32],"received":[33],"much":[34],"attention":[35],"recently.":[36],"this":[38],"paper,":[39],"we":[40,107,143,192,207],"consider":[41],"problem":[43,59,69],"dynamically":[45],"demand-capacity":[47],"types":[48,89],"resources.":[51],"We":[52,171],"formulate":[53],"multi-period,":[55],"many-to-many":[56],"resource-matching":[58,68],"as":[60,210],"sequential":[62],"decision":[63],"process.":[64],"formulated":[66],"involves":[70],"large":[71],"state":[72],"and":[73,76,98,128,161,221,229,236,242],"action":[74],"spaces,":[75],"it":[77],"is":[78],"not":[79],"practical":[80],"to":[81,115,121,132,147,167,209],"accurately":[82],"model":[83],"joint":[85],"distribution":[86],"various":[88],"demands.":[91],"To":[92],"address":[93],"curse":[95],"dimensionality":[97],"difficulty":[100],"explicitly":[102],"modeling":[103],"transition":[105],"dynamics,":[106],"use":[108],"model-free":[110],"deep":[111,200],"reinforcement":[112],"learning":[113],"approach":[114,197],"find":[116],"optimal":[117],"policies.":[119],"Moreover,":[120],"tackle":[122],"issue":[124],"infeasible":[126],"actions":[127],"slow":[129],"convergence":[130,177],"due":[131],"initial":[133],"biased":[134],"estimates":[135],"caused":[136],"by":[137],"maximum":[139],"operator":[140],"Q-learning,":[142],"introduce":[144],"two":[145],"penalties":[146],"traditional":[149,227],"Q-learning":[150,182],"algorithm:":[151],"domain":[153,180,211],"knowledge-based":[154],"penalty":[155,164],"based":[156],"on":[157,175],"prior":[159],"policy":[160,202],"infeasibility":[163],"that":[165],"conforms":[166],"demand-supply":[169],"constraints.":[170],"establish":[172],"theoretical":[173],"results":[174],"our":[179,195,216],"knowledge-informed":[181,212],"providing":[183],"performance":[184],"guarantee":[185],"for":[186],"small-size":[187],"problems.":[188],"For":[189],"large-size":[190],"problems,":[191],"further":[193],"inject":[194],"modified":[196],"into":[198],"deterministic":[201],"gradient":[203],"(DDPG)":[204],"algorithm,":[205],"which":[206],"refer":[208],"DDPG":[213,228],"(DKDDPG).":[214],"computational":[217],"study,":[218],"including":[219],"small-":[220],"large-scale":[222],"experiments,":[223],"DKDDPG":[224],"consistently":[225],"outperformed":[226],"other":[230],"RL":[231],"algorithms,":[232],"yielding":[233],"higher":[234],"rewards":[235],"demonstrating":[237],"greater":[238],"efficiency":[239],"time":[241],"episodes.":[243]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-12-10T00:00:00"}
