{"id":"https://openalex.org/W7138212329","doi":"https://doi.org/10.48550/arxiv.2603.14469","title":"Physics-Informed Policy Optimization via Analytic Dynamics Regularization","display_name":"Physics-Informed Policy Optimization via Analytic Dynamics Regularization","publication_year":2026,"publication_date":"2026-03-15","ids":{"openalex":"https://openalex.org/W7138212329","doi":"https://doi.org/10.48550/arxiv.2603.14469"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.14469","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.14469","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.14469","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129692628","display_name":"Namai Chandra","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chandra, Namai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129658980","display_name":"Liu Mohan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mohan, Liu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5023573700","display_name":"Zhihao Gu","orcid":"https://orcid.org/0009-0002-2000-6955"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gu, Zhihao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129706367","display_name":"Lin Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Lin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6757000088691711,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6757000088691711,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.12380000203847885,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.06369999796152115,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7293999791145325},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.6326000094413757},{"id":"https://openalex.org/keywords/differentiable-function","display_name":"Differentiable function","score":0.4968000054359436},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.48809999227523804},{"id":"https://openalex.org/keywords/residual","display_name":"Residual","score":0.46059998869895935},{"id":"https://openalex.org/keywords/core","display_name":"Core (optical fiber)","score":0.44600000977516174},{"id":"https://openalex.org/keywords/lagrangian","display_name":"Lagrangian","score":0.42289999127388},{"id":"https://openalex.org/keywords/optimal-control","display_name":"Optimal control","score":0.41839998960494995}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7293999791145325},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.6326000094413757},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5788999795913696},{"id":"https://openalex.org/C202615002","wikidata":"https://www.wikidata.org/wiki/Q783507","display_name":"Differentiable function","level":2,"score":0.4968000054359436},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.48809999227523804},{"id":"https://openalex.org/C155512373","wikidata":"https://www.wikidata.org/wiki/Q287450","display_name":"Residual","level":2,"score":0.46059998869895935},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.44600000977516174},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.42899999022483826},{"id":"https://openalex.org/C53469067","wikidata":"https://www.wikidata.org/wiki/Q505735","display_name":"Lagrangian","level":2,"score":0.42289999127388},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.41839998960494995},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.39489999413490295},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.37619999051094055},{"id":"https://openalex.org/C116672817","wikidata":"https://www.wikidata.org/wiki/Q1454986","display_name":"Physical system","level":2,"score":0.3458999991416931},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.3314000070095062},{"id":"https://openalex.org/C77405623","wikidata":"https://www.wikidata.org/wiki/Q598451","display_name":"System dynamics","level":2,"score":0.31690001487731934},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.30880001187324524},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.3000999987125397},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2865000069141388},{"id":"https://openalex.org/C126701199","wikidata":"https://www.wikidata.org/wiki/Q264224","display_name":"Complex dynamics","level":2,"score":0.28220000863075256},{"id":"https://openalex.org/C133731056","wikidata":"https://www.wikidata.org/wiki/Q4917288","display_name":"Control engineering","level":1,"score":0.2687999904155731},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2637999951839447},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2547999918460846},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.2524999976158142}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.14469","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.14469","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.14469","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.14469","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,13,150],"(RL)":[2],"has":[3],"achieved":[4],"strong":[5],"performance":[6],"in":[7,51],"robotic":[8,165],"control;":[9],"however,":[10],"state-of-the-art":[11],"policy":[12,73,112,130],"methods,":[14,18],"such":[15],"as":[16,94],"actor-critic":[17],"still":[19],"suffer":[20],"from":[21,34,41,105],"high":[22],"sample":[23],"complexity":[24],"and":[25,153,162],"often":[26],"produce":[27],"physically":[28,163],"inconsistent":[29],"actions.":[30],"This":[31,102],"limitation":[32],"stems":[33],"neural":[35,72],"policies":[36],"implicitly":[37],"rediscovering":[38],"complex":[39],"physics":[40,78,120],"data":[42],"alone,":[43],"despite":[44],"accurate":[45],"dynamics":[46],"models":[47],"being":[48],"readily":[49],"available":[50],"simulators.":[52],"In":[53],"this":[54,119],"paper,":[55],"we":[56],"introduce":[57],"a":[58,90,95,106,157],"novel":[59],"physics-informed":[60],"RL":[61,140],"framework,":[62],"called":[63],"PIPER,":[64],"that":[65,145],"seamlessly":[66],"integrates":[67],"physical":[68],"constraints":[69],"directly":[70],"into":[71],"optimization":[74],"with":[75],"analytical":[76],"soft":[77],"constraints.":[79],"At":[80],"the":[81,87,99],"core":[82,139],"of":[83,89],"our":[84,146],"method":[85,147],"is":[86,122],"integration":[88,121],"differentiable":[91],"Lagrangian":[92],"residual":[93],"regularization":[96],"term":[97,128],"within":[98],"actor's":[100],"objective.":[101],"residual,":[103],"extracted":[104],"robot's":[107],"simulator":[108],"description,":[109],"subtly":[110],"biases":[111],"updates":[113],"towards":[114],"dynamically":[115],"consistent":[116,164],"solutions.":[117],"Crucially,":[118],"realized":[123],"through":[124],"an":[125],"additional":[126],"loss":[127],"during":[129],"optimization,":[131],"requiring":[132],"no":[133],"alterations":[134],"to":[135],"existing":[136],"simulators":[137],"or":[138],"algorithms.":[141],"Extensive":[142],"experiments":[143],"demonstrate":[144],"significantly":[148],"improves":[149],"efficiency,":[151],"stability,":[152],"control":[154],"accuracy,":[155],"establishing":[156],"new":[158],"paradigm":[159],"for":[160],"efficient":[161],"control.":[166]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-18T00:00:00"}
