{"id":"https://openalex.org/W7164351402","doi":"https://doi.org/10.48550/arxiv.2606.12042","title":"KinematicRL: A Sim-to-Real Reinforcement Learning Framework For Social Navigation With Kinodynamic Feasibility","display_name":"KinematicRL: A Sim-to-Real Reinforcement Learning Framework For Social Navigation With Kinodynamic Feasibility","publication_year":2026,"publication_date":"2026-06-10","ids":{"openalex":"https://openalex.org/W7164351402","doi":"https://doi.org/10.48550/arxiv.2606.12042"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.12042","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.12042","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.12042","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138464036","display_name":"Zhiming Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Zhiming","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5046308214","display_name":"Haodong Yang","orcid":"https://orcid.org/0009-0007-9104-9430"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Haodong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138462196","display_name":"Chengju Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Chengju","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138410120","display_name":"Qijun Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Qijun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138401850","display_name":"Chenpeng Yao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yao, Chenpeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10709","display_name":"Social Robot Interaction and HRI","score":0.5236999988555908,"subfield":{"id":"https://openalex.org/subfields/3207","display_name":"Social Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T10709","display_name":"Social Robot Interaction and HRI","score":0.5236999988555908,"subfield":{"id":"https://openalex.org/subfields/3207","display_name":"Social Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11500","display_name":"Evacuation and Crowd Dynamics","score":0.07129999995231628,"subfield":{"id":"https://openalex.org/subfields/2212","display_name":"Ocean Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.05869999900460243,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6629999876022339},{"id":"https://openalex.org/keywords/iterative-learning-control","display_name":"Iterative learning control","score":0.531000018119812},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.511900007724762},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.4991999864578247},{"id":"https://openalex.org/keywords/linear-quadratic-regulator","display_name":"Linear-quadratic regulator","score":0.46970000863075256},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.42890000343322754},{"id":"https://openalex.org/keywords/kinematics","display_name":"Kinematics","score":0.4187000095844269},{"id":"https://openalex.org/keywords/position","display_name":"Position (finance)","score":0.3856000006198883},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.3677000105381012},{"id":"https://openalex.org/keywords/tracking","display_name":"Tracking (education)","score":0.3418000042438507}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6629999876022339},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5641999840736389},{"id":"https://openalex.org/C117619785","wikidata":"https://www.wikidata.org/wiki/Q6094414","display_name":"Iterative learning control","level":3,"score":0.531000018119812},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.511900007724762},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.4991999864578247},{"id":"https://openalex.org/C98779006","wikidata":"https://www.wikidata.org/wiki/Q2520550","display_name":"Linear-quadratic regulator","level":3,"score":0.46970000863075256},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.42890000343322754},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4223000109195709},{"id":"https://openalex.org/C39920418","wikidata":"https://www.wikidata.org/wiki/Q11476","display_name":"Kinematics","level":2,"score":0.4187000095844269},{"id":"https://openalex.org/C198082294","wikidata":"https://www.wikidata.org/wiki/Q3399648","display_name":"Position (finance)","level":2,"score":0.3856000006198883},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.3677000105381012},{"id":"https://openalex.org/C2775936607","wikidata":"https://www.wikidata.org/wiki/Q466845","display_name":"Tracking (education)","level":2,"score":0.3418000042438507},{"id":"https://openalex.org/C155512373","wikidata":"https://www.wikidata.org/wiki/Q287450","display_name":"Residual","level":2,"score":0.32580000162124634},{"id":"https://openalex.org/C133731056","wikidata":"https://www.wikidata.org/wiki/Q4917288","display_name":"Control engineering","level":1,"score":0.3149000108242035},{"id":"https://openalex.org/C2777210771","wikidata":"https://www.wikidata.org/wiki/Q4927124","display_name":"Block (permutation group theory)","level":2,"score":0.3068000078201294},{"id":"https://openalex.org/C93226319","wikidata":"https://www.wikidata.org/wiki/Q193137","display_name":"Differential (mechanical device)","level":2,"score":0.30640000104904175},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.302700012922287},{"id":"https://openalex.org/C2780023022","wikidata":"https://www.wikidata.org/wiki/Q1338171","display_name":"Compensation (psychology)","level":2,"score":0.2937000095844269},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.2890999913215637},{"id":"https://openalex.org/C6683253","wikidata":"https://www.wikidata.org/wiki/Q7075535","display_name":"Obstacle avoidance","level":4,"score":0.2854999899864197},{"id":"https://openalex.org/C2777798563","wikidata":"https://www.wikidata.org/wiki/Q7603916","display_name":"State vector","level":2,"score":0.2815999984741211},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.27790001034736633},{"id":"https://openalex.org/C19966478","wikidata":"https://www.wikidata.org/wiki/Q4810574","display_name":"Mobile robot","level":3,"score":0.27709999680519104},{"id":"https://openalex.org/C129844170","wikidata":"https://www.wikidata.org/wiki/Q41299","display_name":"Quadratic equation","level":2,"score":0.2766999900341034},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.2703999876976013},{"id":"https://openalex.org/C183356978","wikidata":"https://www.wikidata.org/wiki/Q1779213","display_name":"Tracking error","level":3,"score":0.26919999718666077},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.2651999890804291},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.2651999890804291},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2578999996185303},{"id":"https://openalex.org/C65401140","wikidata":"https://www.wikidata.org/wiki/Q7353385","display_name":"Robot control","level":4,"score":0.25459998846054077},{"id":"https://openalex.org/C152124472","wikidata":"https://www.wikidata.org/wiki/Q1204361","display_name":"Redundancy (engineering)","level":2,"score":0.25279998779296875},{"id":"https://openalex.org/C81845259","wikidata":"https://www.wikidata.org/wiki/Q290117","display_name":"Quadratic programming","level":2,"score":0.25099998712539673},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.2502000033855438}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.12042","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.12042","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.12042","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.12042","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","score":0.49638038873672485,"display_name":"Reduced inequalities"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Deep":[0],"Reinforcement":[1],"Learning":[2],"(DRL)":[3],"has":[4],"shown":[5],"promise":[6],"for":[7,49,179],"social":[8,180],"navigation,":[9],"yet":[10],"its":[11],"real-world":[12,50,200],"deployment":[13],"remains":[14],"hindered":[15],"by":[16,94],"a":[17,35,95,107,121,216],"persistent":[18],"sim-to-real":[19],"gap":[20],"arising":[21],"from":[22],"simplified":[23],"first-order":[24],"dynamics":[25],"and":[26,61,141,150,169,190],"context-specific":[27],"human":[28,123],"state":[29],"estimation":[30],"pipelines.":[31],"This":[32],"work":[33],"presents":[34],"unified":[36],"framework":[37],"that":[38,56,102],"addresses":[39],"these":[40],"limitations":[41],"to":[42,87,112,137,166,192],"produce":[43],"dynamically":[44],"feasible":[45],"navigation":[46],"policies":[47],"suitable":[48],"deployment.":[51],"First,":[52],"theoretical":[53],"analysis":[54],"reveals":[55],"tracking":[57,124,209],"error":[58],"between":[59],"simulated":[60],"actual":[62],"robot":[63,220],"position":[64],"decays":[65],"exponentially":[66],"with":[67,206,221],"increased":[68],"control":[69,76,84],"order,":[70],"motivating":[71],"the":[72,104,114,207],"use":[73],"of":[74,118,147,195],"higher-order":[75],"inputs":[77],"as":[78],"DRL":[79],"action":[80],"space.":[81],"A":[82],"second-order":[83],"formulation":[85],"tailored":[86],"differential":[88,218],"drive":[89,219],"robots":[90],"is":[91,130],"developed,":[92],"complemented":[93],"stochastic":[96],"iterative":[97],"Linear":[98],"Quadratic":[99],"Regulator":[100],"(iLQR)":[101],"pretrains":[103],"policy":[105],"via":[106],"divergence":[108],"minimization":[109],"objective.":[110],"Second,":[111],"avoid":[113],"added":[115],"system":[116],"complexity":[117],"camera-LiDAR":[119],"fusion,":[120],"cluster-based":[122],"pipeline":[125],"using":[126],"only":[127],"2D":[128],"LiDAR":[129],"introduced.":[131],"Human":[132],"detections":[133],"are":[134],"associated":[135],"according":[136],"both":[138,177],"spatial":[139],"proximity":[140],"velocity":[142,153],"similarity,":[143],"enabling":[144],"reliable":[145],"differentiation":[146],"nearby":[148],"pedestrians":[149],"yielding":[151],"stable":[152],"estimates":[154],"through":[155],"temporal":[156],"aggregation.":[157],"Third,":[158],"we":[159],"introduce":[160],"an":[161],"unbiased":[162],"residual":[163],"gating":[164],"block":[165],"balance":[167],"reaction-":[168],"memory-based":[170],"behaviors":[171],"while":[172],"handling":[173],"time-varying":[174],"crowd":[175],"sizes,":[176],"critical":[178],"navigation.":[181],"The":[182],"resulting":[183],"policy,":[184],"KinematicRL,":[185],"consistently":[186],"improves":[187],"kinematic":[188],"performance":[189],"adapts":[191],"varying":[193],"number":[194],"detected":[196],"humans.":[197],"Experiments":[198],"in":[199],"environments":[201],"demonstrate":[202],"that,":[203],"when":[204],"combined":[205],"proposed":[208],"pipeline,":[210],"KinematicRL":[211],"can":[212],"be":[213],"deployed":[214],"on":[215],"real":[217],"minimal":[222],"modifications.":[223]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-12T00:00:00"}
