{"id":"https://openalex.org/W7166583681","doi":"https://doi.org/10.48550/arxiv.2606.27861","title":"PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control","display_name":"PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control","publication_year":2026,"publication_date":"2026-06-26","ids":{"openalex":"https://openalex.org/W7166583681","doi":"https://doi.org/10.48550/arxiv.2606.27861"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.27861","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.27861","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.27861","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5005721517","display_name":"Jiatao Ding","orcid":"https://orcid.org/0000-0002-2396-9688"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ding, Jiatao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5034832674","display_name":"Songqun Gao","orcid":"https://orcid.org/0000-0002-2434-8656"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gao, Songqun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139575854","display_name":"Andrea Del Prete","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Del Prete, Andrea","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5031898170","display_name":"Matteo Saveriano","orcid":"https://orcid.org/0000-0002-9784-3973"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Saveriano, Matteo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.29319998621940613,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.29319998621940613,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.23180000483989716,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11023","display_name":"Prosthetics and Rehabilitation Robotics","score":0.07050000131130219,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6367999911308289},{"id":"https://openalex.org/keywords/lagrange-multiplier","display_name":"Lagrange multiplier","score":0.5952000021934509},{"id":"https://openalex.org/keywords/augmented-lagrangian-method","display_name":"Augmented Lagrangian method","score":0.5920000076293945},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5393999814987183},{"id":"https://openalex.org/keywords/constraint","display_name":"Constraint (computer-aided design)","score":0.48820000886917114},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.4778999984264374},{"id":"https://openalex.org/keywords/interleaving","display_name":"Interleaving","score":0.415800005197525},{"id":"https://openalex.org/keywords/constraint-satisfaction","display_name":"Constraint satisfaction","score":0.4074999988079071},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.3984000086784363},{"id":"https://openalex.org/keywords/quadratic-equation","display_name":"Quadratic equation","score":0.36719998717308044}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6367999911308289},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6269999742507935},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.6044999957084656},{"id":"https://openalex.org/C73684929","wikidata":"https://www.wikidata.org/wiki/Q598870","display_name":"Lagrange multiplier","level":2,"score":0.5952000021934509},{"id":"https://openalex.org/C150452318","wikidata":"https://www.wikidata.org/wiki/Q4820432","display_name":"Augmented Lagrangian method","level":2,"score":0.5920000076293945},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5393999814987183},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.48820000886917114},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.4778999984264374},{"id":"https://openalex.org/C28034677","wikidata":"https://www.wikidata.org/wiki/Q17092530","display_name":"Interleaving","level":2,"score":0.415800005197525},{"id":"https://openalex.org/C44616089","wikidata":"https://www.wikidata.org/wiki/Q30158686","display_name":"Constraint satisfaction","level":3,"score":0.4074999988079071},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.3984000086784363},{"id":"https://openalex.org/C129844170","wikidata":"https://www.wikidata.org/wiki/Q41299","display_name":"Quadratic equation","level":2,"score":0.36719998717308044},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.3668000102043152},{"id":"https://openalex.org/C91765299","wikidata":"https://www.wikidata.org/wiki/Q3424292","display_name":"Lagrangian relaxation","level":2,"score":0.3650999963283539},{"id":"https://openalex.org/C55660270","wikidata":"https://www.wikidata.org/wiki/Q5164377","display_name":"Constrained optimization","level":2,"score":0.3619999885559082},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.35519999265670776},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.34470000863075256},{"id":"https://openalex.org/C203479927","wikidata":"https://www.wikidata.org/wiki/Q5165939","display_name":"Controller (irrigation)","level":2,"score":0.3434999883174896},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.32170000672340393},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.30730000138282776},{"id":"https://openalex.org/C2779110517","wikidata":"https://www.wikidata.org/wiki/Q1240788","display_name":"Supervisor","level":2,"score":0.29440000653266907},{"id":"https://openalex.org/C133731056","wikidata":"https://www.wikidata.org/wiki/Q4917288","display_name":"Control engineering","level":1,"score":0.2937000095844269},{"id":"https://openalex.org/C81845259","wikidata":"https://www.wikidata.org/wiki/Q290117","display_name":"Quadratic programming","level":2,"score":0.2921999990940094},{"id":"https://openalex.org/C150415221","wikidata":"https://www.wikidata.org/wiki/Q40687","display_name":"Robotic arm","level":2,"score":0.2904999852180481},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.2892000079154968},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.2799000144004822},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.2793999910354614},{"id":"https://openalex.org/C2779777834","wikidata":"https://www.wikidata.org/wiki/Q4202277","display_name":"Enforcement","level":2,"score":0.26669999957084656},{"id":"https://openalex.org/C6180225","wikidata":"https://www.wikidata.org/wiki/Q3411771","display_name":"Penalty method","level":2,"score":0.2639999985694885},{"id":"https://openalex.org/C198927703","wikidata":"https://www.wikidata.org/wiki/Q4373881","display_name":"Sequential quadratic programming","level":3,"score":0.25949999690055847},{"id":"https://openalex.org/C173404611","wikidata":"https://www.wikidata.org/wiki/Q528588","display_name":"Constraint programming","level":3,"score":0.25929999351501465},{"id":"https://openalex.org/C206729178","wikidata":"https://www.wikidata.org/wiki/Q2271896","display_name":"Scheduling (production processes)","level":2,"score":0.2531999945640564}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.27861","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.27861","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.27861","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.27861","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.7513588070869446,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"has":[3],"emerged":[4],"as":[5,187],"a":[6,54,164,188],"promising":[7],"solution":[8],"to":[9,28,41],"accomplish":[10],"complex":[11],"robotic":[12,73,131,199],"control":[13],"tasks;":[14],"however,":[15],"most":[16],"of":[17],"the":[18,22,43],"current":[19,38],"work":[20,51],"ignores":[21],"safety":[23,145],"requirements.":[24],"Safe":[25],"RL":[26,155,194],"seeks":[27],"maximize":[29],"task":[30,113,173],"performance":[31,149],"while":[32,111],"satisfying":[33],"explicit":[34],"physical":[35],"constraints,":[36],"but":[37],"algorithms":[39],"struggle":[40],"learn":[42],"policy":[44,58,69,78],"efficiently":[45],"with":[46,80,151],"precise":[47],"constraint":[48,89,106],"satisfaction.":[49],"This":[50],"proposes":[52],"PPO-EAL,":[53],"novel":[55],"first-order":[56,153],"constrained":[57],"optimization":[59,66,70],"framework":[60,195],"that":[61],"integrates":[62],"exact":[63,81],"augmented":[64],"Lagrangian":[65],"into":[67],"proximal":[68],"for":[71,196],"safe":[72,154,193],"control.":[74],"By":[75],"combining":[76],"clipped":[77],"updates":[79],"quadratic":[82],"penalty":[83,95],"terms,":[84],"PPO-EAL":[85,170,186],"achieves":[86],"theoretically":[87],"grounded":[88],"enforcement":[90],"without":[91],"requiring":[92],"impractically":[93],"large":[94],"factors.":[96],"A":[97],"momentum-regulated":[98],"multiplier":[99],"update":[100],"further":[101],"improves":[102,172],"dual-variable":[103],"stability,":[104],"reducing":[105],"oscillation":[107],"and":[108,118,141,147,179,190],"unsafe":[109],"behavior":[110],"preserving":[112],"performance.":[114],"We":[115],"provide":[116],"exactness":[117],"convergence":[119],"analysis":[120],"under":[121],"standard":[122],"stochastic":[123],"approximation":[124],"assumptions.":[125],"Extensive":[126],"validation":[127],"across":[128],"diverse":[129,197],"GPU-accelerated":[130],"benchmarks-including":[132],"cart-pole":[133],"balancing,":[134],"cart-double-pendulum":[135],"stabilization,":[136],"7-DoF":[137],"Franka":[138],"end-effector":[139],"reaching,":[140],"quadrupedal":[142],"locomotion-demonstrates":[143],"superior":[144],"precision":[146],"reward":[148],"compared":[150],"state-of-the-art":[152],"baselines.":[156],"Finally,":[157],"we":[158],"demonstrate":[159],"zero-shot":[160],"sim-to-real":[161],"deployment":[162],"in":[163],"contact-rich":[165],"gear":[166],"assembly":[167],"task,":[168],"where":[169],"substantially":[171],"success,":[174],"reduces":[175],"peak":[176],"contact":[177],"force,":[178],"enhances":[180],"operational":[181],"robustness.":[182],"These":[183],"results":[184],"establish":[185],"general":[189],"practically":[191],"deployable":[192],"safety-critical":[198],"systems.":[200]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-30T00:00:00"}
