{"id":"https://openalex.org/W7160545998","doi":"https://doi.org/10.48550/arxiv.2605.04185","title":"Constraint-Enhanced Reinforcement Learning Based on Dynamic Decoupled Spherical Radial Squashing","display_name":"Constraint-Enhanced Reinforcement Learning Based on Dynamic Decoupled Spherical Radial Squashing","publication_year":2026,"publication_date":"2026-05-05","ids":{"openalex":"https://openalex.org/W7160545998","doi":"https://doi.org/10.48550/arxiv.2605.04185"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.04185","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.04185","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.04185","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5067714339","display_name":"Qijun Liao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liao, Qijun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103130374","display_name":"Z. Yu","orcid":"https://orcid.org/0000-0001-8890-0924"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yu, Zhaoxin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5054363500","display_name":"Jue Yang","orcid":"https://orcid.org/0000-0003-2985-1071"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Jue","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.3831000030040741,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.3831000030040741,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.353300005197525,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10784","display_name":"Muscle activation and electromyography studies","score":0.04479999840259552,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.630299985408783},{"id":"https://openalex.org/keywords/solver","display_name":"Solver","score":0.5846999883651733},{"id":"https://openalex.org/keywords/constraint","display_name":"Constraint (computer-aided design)","score":0.5777000188827515},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.5271000266075134},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.5170000195503235},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.4993000030517578},{"id":"https://openalex.org/keywords/humanoid-robot","display_name":"Humanoid robot","score":0.4973999857902527},{"id":"https://openalex.org/keywords/actuator","display_name":"Actuator","score":0.4763999879360199},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.45170000195503235},{"id":"https://openalex.org/keywords/upper-and-lower-bounds","display_name":"Upper and lower bounds","score":0.4390000104904175}],"concepts":[{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.630299985408783},{"id":"https://openalex.org/C2778770139","wikidata":"https://www.wikidata.org/wiki/Q1966904","display_name":"Solver","level":2,"score":0.5846999883651733},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.5777000188827515},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.5271000266075134},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.5170000195503235},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.4993000030517578},{"id":"https://openalex.org/C60692881","wikidata":"https://www.wikidata.org/wiki/Q584529","display_name":"Humanoid robot","level":3,"score":0.4973999857902527},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.49729999899864197},{"id":"https://openalex.org/C172707124","wikidata":"https://www.wikidata.org/wiki/Q423488","display_name":"Actuator","level":2,"score":0.4763999879360199},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.4657000005245209},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.45170000195503235},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.4390000104904175},{"id":"https://openalex.org/C165464430","wikidata":"https://www.wikidata.org/wiki/Q1570441","display_name":"Parameterized complexity","level":2,"score":0.421099990606308},{"id":"https://openalex.org/C163258240","wikidata":"https://www.wikidata.org/wiki/Q25342","display_name":"Power (physics)","level":2,"score":0.40689998865127563},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.4007999897003174},{"id":"https://openalex.org/C117896860","wikidata":"https://www.wikidata.org/wiki/Q11376","display_name":"Acceleration","level":2,"score":0.4007999897003174},{"id":"https://openalex.org/C57493831","wikidata":"https://www.wikidata.org/wiki/Q3134666","display_name":"Projection (relational algebra)","level":2,"score":0.397599995136261},{"id":"https://openalex.org/C184050105","wikidata":"https://www.wikidata.org/wiki/Q273163","display_name":"Isotropy","level":2,"score":0.3880999982357025},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.3837999999523163},{"id":"https://openalex.org/C2780813799","wikidata":"https://www.wikidata.org/wiki/Q3274237","display_name":"Zero (linguistics)","level":2,"score":0.38190001249313354},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.35679998993873596},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3418999910354614},{"id":"https://openalex.org/C761482","wikidata":"https://www.wikidata.org/wiki/Q118093","display_name":"Transmission (telecommunications)","level":2,"score":0.34139999747276306},{"id":"https://openalex.org/C18555067","wikidata":"https://www.wikidata.org/wiki/Q8375051","display_name":"Joint (building)","level":2,"score":0.33959999680519104},{"id":"https://openalex.org/C178635117","wikidata":"https://www.wikidata.org/wiki/Q747499","display_name":"RADIUS","level":2,"score":0.3244999945163727},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.32280001044273376},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.3215000033378601},{"id":"https://openalex.org/C31487907","wikidata":"https://www.wikidata.org/wiki/Q1154597","display_name":"Polygon mesh","level":2,"score":0.3212999999523163},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.32109999656677246},{"id":"https://openalex.org/C39920418","wikidata":"https://www.wikidata.org/wiki/Q11476","display_name":"Kinematics","level":2,"score":0.27320000529289246},{"id":"https://openalex.org/C144171764","wikidata":"https://www.wikidata.org/wiki/Q48103","display_name":"Torque","level":2,"score":0.26809999346733093},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.2639999985694885},{"id":"https://openalex.org/C2779304628","wikidata":"https://www.wikidata.org/wiki/Q3503480","display_name":"Face (sociological concept)","level":2,"score":0.25769999623298645},{"id":"https://openalex.org/C2777210771","wikidata":"https://www.wikidata.org/wiki/Q4927124","display_name":"Block (permutation group theory)","level":2,"score":0.2542000114917755},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.25360000133514404},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.2535000145435333},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.25130000710487366}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.04185","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.04185","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.04185","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.04185","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.46936511993408203,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"When":[0],"deploying":[1],"reinforcement":[2],"learning":[3],"policies":[4],"to":[5,34,51,193],"physical":[6],"robots,":[7],"actuator":[8],"rate":[9],"constraints":[10,120],"--":[11,24,151,157],"hard":[12,119],"limits":[13,28],"on":[14],"how":[15],"fast":[16],"each":[17,105],"joint":[18,184],"can":[19],"move":[20],"per":[21],"control":[22],"step":[23],"are":[25],"unavoidable.":[26],"These":[27],"vary":[29],"substantially":[30],"across":[31],"joints":[32],"due":[33],"differences":[35],"in":[36,62,161],"motor":[37],"inertia,":[38],"power":[39],"bandwidth,":[40],"and":[41,68,128,173],"transmission":[42],"stiffness,":[43],"creating":[44],"pronounced":[45],"heterogeneity":[46,83],"that":[47],"existing":[48],"methods":[49,71],"fail":[50],"handle":[52],"geometrically:":[53],"the":[54,78,111,143,153],"per-joint":[55,113],"feasible":[56,80,114],"region":[57],"forms":[58],"a":[59,100,187],"high-dimensional":[60],"box":[61],"action-increment":[63],"space,":[64],"yet":[65],"QP":[66],"projection":[67],"spherical":[69,165],"parameterization":[70],"impose":[72],"isotropic":[73],"ball-shaped":[74],"constraints,":[75],"exponentially":[76],"under-covering":[77],"true":[79,112],"set":[81],"as":[82],"grows.":[84],"This":[85],"paper":[86],"proposes":[87],"Dynamic":[88],"Decoupled":[89],"Spherical":[90],"Radial":[91],"Squashing":[92],"(DD-SRad),":[93],"which":[94],"resolves":[95],"this":[96],"mismatch":[97],"by":[98],"computing":[99],"position-adaptive":[101],"radius":[102],"independently":[103],"for":[104],"actuator,":[106],"achieving":[107],"tight":[108],"alignment":[109],"with":[110,121,134,158,170],"region.":[115],"DD-SRad":[116],"satisfies":[117],"per-step":[118],"probability~1,":[122],"preserves":[123],"well-conditioned":[124],"gradients":[125],"throughout":[126],"training,":[127],"admits":[129],"exact":[130],"policy":[131],"gradient":[132],"backpropagation":[133],"zero":[135,148],"runtime":[136],"solver":[137],"overhead.":[138],"MuJoCo":[139],"benchmark":[140],"experiments":[141],"demonstrate":[142],"highest":[144],"task":[145],"return":[146],"at":[147],"constraint":[149],"violation":[150],"matching":[152],"unconstrained":[154],"upper":[155],"bound":[156],"30%--50%":[159],"improvement":[160],"constraint-space":[162],"coverage":[163],"over":[164],"baselines.":[166],"High-fidelity":[167],"IsaacLab":[168],"simulations":[169],"Unitree":[171],"H1":[172],"G1":[174],"humanoid":[175],"robots":[176],"confirm":[177],"end-to-end":[178],"optimality":[179],"parameterized":[180],"directly":[181],"from":[182,190],"official":[183],"specifications,":[185],"validating":[186],"systematic":[188],"pathway":[189],"hardware":[191],"datasheets":[192],"safe":[194],"deployment.":[195]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-08T00:00:00"}
