{"id":"https://openalex.org/W7140214064","doi":"https://doi.org/10.48550/arxiv.2603.20295","title":"MARLIN: Multi-Agent Reinforcement Learning for Incremental DAG Discovery","display_name":"MARLIN: Multi-Agent Reinforcement Learning for Incremental DAG Discovery","publication_year":2026,"publication_date":"2026-03-19","ids":{"openalex":"https://openalex.org/W7140214064","doi":"https://doi.org/10.48550/arxiv.2603.20295"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.20295","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.20295","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.20295","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Li, Dong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Dong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Chen, Zhengzhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Zhengzhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Zhao, Xujiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Xujiang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Yu, Linlin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yu, Linlin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Chen, Zhong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Zhong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"He, Yi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"He, Yi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Chen, Haifeng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Haifeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"Zhao, Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11303","display_name":"Bayesian Modeling and Causal Inference","score":0.34360000491142273,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11303","display_name":"Bayesian Modeling and Causal Inference","score":0.34360000491142273,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11273","display_name":"Advanced Graph Neural Networks","score":0.08540000021457672,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.07069999724626541,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/directed-acyclic-graph","display_name":"Directed acyclic graph","score":0.8565000295639038},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7750999927520752},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.5752000212669373},{"id":"https://openalex.org/keywords/directed-graph","display_name":"Directed graph","score":0.48249998688697815},{"id":"https://openalex.org/keywords/graph","display_name":"Graph","score":0.4431000053882599},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.43799999356269836},{"id":"https://openalex.org/keywords/space","display_name":"Space (punctuation)","score":0.4196999967098236}],"concepts":[{"id":"https://openalex.org/C74197172","wikidata":"https://www.wikidata.org/wiki/Q1195339","display_name":"Directed acyclic graph","level":2,"score":0.8565000295639038},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7750999927520752},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6985999941825867},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5859000086784363},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.5752000212669373},{"id":"https://openalex.org/C146380142","wikidata":"https://www.wikidata.org/wiki/Q1137726","display_name":"Directed graph","level":2,"score":0.48249998688697815},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.48159998655319214},{"id":"https://openalex.org/C132525143","wikidata":"https://www.wikidata.org/wiki/Q141488","display_name":"Graph","level":2,"score":0.4431000053882599},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.43799999356269836},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.4196999967098236},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.3903999924659729},{"id":"https://openalex.org/C2780735816","wikidata":"https://www.wikidata.org/wiki/Q28324931","display_name":"Incremental learning","level":2,"score":0.36059999465942383},{"id":"https://openalex.org/C114073186","wikidata":"https://www.wikidata.org/wiki/Q2631895","display_name":"Automated planning and scheduling","level":2,"score":0.3140999972820282},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.3122999966144562},{"id":"https://openalex.org/C190470478","wikidata":"https://www.wikidata.org/wiki/Q2370229","display_name":"Invariant (physics)","level":2,"score":0.31040000915527344},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.30550000071525574},{"id":"https://openalex.org/C176032523","wikidata":"https://www.wikidata.org/wiki/Q753127","display_name":"Topological sorting","level":3,"score":0.2842000126838684},{"id":"https://openalex.org/C2988382989","wikidata":"https://www.wikidata.org/wiki/Q370685","display_name":"Data space","level":2,"score":0.28200000524520874}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.20295","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.20295","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.20295","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.20295","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Uncovering":[0],"causal":[1,98],"structures":[2,26],"from":[3],"observational":[4],"data":[5],"is":[6],"crucial":[7],"for":[8,44,60],"understanding":[9],"complex":[10],"systems":[11],"and":[12,93,100,125,142],"making":[13,41],"informed":[14],"decisions.":[15],"While":[16],"reinforcement":[17],"learning":[18,107],"(RL)":[19],"has":[20],"shown":[21],"promise":[22],"in":[23,27,137],"identifying":[24],"these":[25,102],"the":[28,78,110,134],"form":[29],"of":[30,133,139],"a":[31,66,72,113],"directed":[32],"acyclic":[33],"graph":[34],"(DAG),":[35],"existing":[36],"methods":[37,136],"often":[38],"lack":[39],"efficiency,":[40],"them":[42],"unsuitable":[43],"online":[45],"applications.":[46],"In":[47],"this":[48],"paper,":[49],"we":[50],"propose":[51],"MARLIN,":[52],"an":[53,82,105],"efficient":[54],"multi":[55],"agent":[56],"RL":[57,89],"based":[58],"approach":[59],"incremental":[61,106],"DAG":[62,67,79],"learning.":[63],"MARLIN":[64,130],"uses":[65],"generation":[68],"policy":[69],"that":[70,129],"maps":[71],"continuous":[73],"real":[74,126],"valued":[75],"space":[76,80,116],"to":[77,96,117],"as":[81],"intra":[83],"batch":[84],"strategy,":[85],"then":[86],"incorporates":[87],"two":[88],"agents":[90,103],"state":[91,94,132],"specific":[92],"invariant":[95],"uncover":[97],"relationships":[99],"integrates":[101],"into":[104],"framework.":[108],"Furthermore,":[109],"framework":[111],"leverages":[112],"factored":[114],"action":[115],"enhance":[118],"parallelization":[119],"efficiency.":[120],"Extensive":[121],"experiments":[122],"on":[123],"synthetic":[124],"datasets":[127],"demonstrate":[128],"outperforms":[131],"art":[135],"terms":[138],"both":[140],"efficiency":[141],"effectiveness.":[143]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-25T00:00:00"}
