{"id":"https://openalex.org/W7133872857","doi":"https://doi.org/10.48550/arxiv.2603.03741","title":"HALO: Learning Human-Robot Collaboration via Heterogeneous-Agent Lyapunov Policy Optimization","display_name":"HALO: Learning Human-Robot Collaboration via Heterogeneous-Agent Lyapunov Policy Optimization","publication_year":2026,"publication_date":"2026-03-04","ids":{"openalex":"https://openalex.org/W7133872857","doi":"https://doi.org/10.48550/arxiv.2603.03741"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.03741","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128142252","display_name":"Hao F. Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Hao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5038029802","display_name":"Yaru Niu","orcid":"https://orcid.org/0000-0003-0782-6385"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Niu, Yaru","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128180964","display_name":"Yikai Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Yikai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128201082","display_name":"Ding Zhao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Ding","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5128215626","display_name":"H. Eric Tseng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tseng, H. Eric","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.27013914,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7699000239372253,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7699000239372253,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.11159999668598175,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10709","display_name":"Social Robot Interaction and HRI","score":0.035999998450279236,"subfield":{"id":"https://openalex.org/subfields/3207","display_name":"Social Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/lyapunov-function","display_name":"Lyapunov function","score":0.6262999773025513},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.57669997215271},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.4880000054836273},{"id":"https://openalex.org/keywords/lyapunov-stability","display_name":"Lyapunov stability","score":0.450300008058548},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.4471000134944916},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.4246000051498413},{"id":"https://openalex.org/keywords/differentiable-function","display_name":"Differentiable function","score":0.40799999237060547},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.3928999900817871},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.38179999589920044}],"concepts":[{"id":"https://openalex.org/C60640748","wikidata":"https://www.wikidata.org/wiki/Q2337858","display_name":"Lyapunov function","level":3,"score":0.6262999773025513},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.6194000244140625},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.57669997215271},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5612000226974487},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.4880000054836273},{"id":"https://openalex.org/C2776829284","wikidata":"https://www.wikidata.org/wiki/Q1341651","display_name":"Lyapunov stability","level":3,"score":0.450300008058548},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.4471000134944916},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.4246000051498413},{"id":"https://openalex.org/C202615002","wikidata":"https://www.wikidata.org/wiki/Q783507","display_name":"Differentiable function","level":2,"score":0.40799999237060547},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.3928999900817871},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.38179999589920044},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.37119999527931213},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.36039999127388},{"id":"https://openalex.org/C129844170","wikidata":"https://www.wikidata.org/wiki/Q41299","display_name":"Quadratic equation","level":2,"score":0.3449999988079071},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.33880001306533813},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.32850000262260437},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.32030001282691956},{"id":"https://openalex.org/C143170015","wikidata":"https://www.wikidata.org/wiki/Q17007850","display_name":"Stability conditions","level":3,"score":0.31700000166893005},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.31360000371932983},{"id":"https://openalex.org/C201717286","wikidata":"https://www.wikidata.org/wiki/Q938185","display_name":"Rationality","level":2,"score":0.31150001287460327},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.30869999527931213},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.30709999799728394},{"id":"https://openalex.org/C101403955","wikidata":"https://www.wikidata.org/wiki/Q6707083","display_name":"Lyapunov optimization","level":5,"score":0.29980000853538513},{"id":"https://openalex.org/C161999928","wikidata":"https://www.wikidata.org/wiki/Q4556320","display_name":"Variational inequality","level":2,"score":0.2736000120639801},{"id":"https://openalex.org/C94766913","wikidata":"https://www.wikidata.org/wiki/Q1530271","display_name":"Equilibrium point","level":3,"score":0.2669999897480011},{"id":"https://openalex.org/C72169020","wikidata":"https://www.wikidata.org/wiki/Q194404","display_name":"Monotonic function","level":2,"score":0.25940001010894775}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.03741","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.03741","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.03741","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.03741","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"publisher-specific-oa","license_id":"https://openalex.org/licenses/publisher-specific-oa","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.46103793382644653,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"To":[0],"improve":[1],"generalization":[2,141],"and":[3,18,30,121,131,142],"resilience":[4],"in":[5,83,94,144],"human-robot":[6],"collaboration":[7],"(HRC),":[8],"robots":[9,29],"must":[10],"contend":[11],"with":[12],"diverse":[13],"combinations":[14],"of":[15,119,125],"human":[16],"behaviors":[17],"contexts,":[19],"motivating":[20],"multi-agent":[21],"reinforcement":[22],"learning":[23,48],"(MARL).":[24],"However,":[25],"inherent":[26],"heterogeneity":[27],"between":[28],"humans":[31],"creates":[32],"a":[33,51,73],"rationality":[34],"gap":[35],"(RG),":[36],"where":[37],"decentralized":[38,77,105,110],"policy":[39,70,106],"updates":[40,58],"deviate":[41],"from":[42],"cooperative":[43],"joint":[44],"optimization.":[45],"The":[46],"resulting":[47],"problem":[49],"is":[50,151],"general-sum":[52],"differentiable":[53],"game,":[54],"so":[55],"independent":[56],"policy-gradient":[57],"can":[59],"oscillate":[60],"or":[61],"diverge":[62],"without":[63],"added":[64],"structure.":[65],"We":[66],"propose":[67],"heterogeneous-agent":[68],"Lyapunov":[69,101],"optimization":[71],"(HALO),":[72],"framework":[74],"that":[75,136],"stabilizes":[76],"MARL":[78],"by":[79],"enforcing":[80],"Lyapunov-based":[81,87],"contraction":[82,118],"policy-parameter":[84],"space.":[85],"Unlike":[86],"safe":[88],"RL,":[89],"which":[90],"targets":[91],"state/trajectory":[92],"constraints":[93],"constrained":[95],"Markov":[96],"decision":[97],"processes,":[98],"HALO":[99,108],"uses":[100],"certification":[102],"to":[103],"stabilize":[104],"learning.":[107],"rectifies":[109],"gradients":[111],"via":[112],"optimal":[113],"quadratic":[114],"projections,":[115],"ensuring":[116],"monotonic":[117],"RG":[120],"enabling":[122],"effective":[123],"exploration":[124],"open-ended":[126],"interaction":[127],"spaces.":[128],"Extensive":[129],"simulations":[130],"real-world":[132],"humanoid-robot":[133],"experiments":[134],"show":[135],"this":[137],"certified":[138],"stability":[139],"improves":[140],"robustness":[143],"collaborative":[145],"corner":[146],"cases.":[147],"Our":[148],"project":[149],"website":[150],"available":[152],"at":[153],"https://HaoZhang-THU.github.io/HALO/.":[154]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-06T00:00:00"}
