{"id":"https://openalex.org/W7167783605","doi":"https://doi.org/10.48550/arxiv.2607.07001","title":"Ego-Human Motion Prediction with 3D-Aware LLM","display_name":"Ego-Human Motion Prediction with 3D-Aware LLM","publication_year":2026,"publication_date":"2026-07-08","ids":{"openalex":"https://openalex.org/W7167783605","doi":"https://doi.org/10.48550/arxiv.2607.07001"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2607.07001","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.07001","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2607.07001","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5140342372","display_name":"Yujin Bae","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bae, Yujin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140373195","display_name":"Jaewoo Jeong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jeong, Jaewoo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140306665","display_name":"Hyeonseong Kim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Hyeonseong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5140303529","display_name":"Kuk-Jin Yoon","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yoon, Kuk-Jin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.4909999966621399,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10812","display_name":"Human Pose and Action Recognition","score":0.4909999966621399,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12290","display_name":"Human Motion and Animation","score":0.31040000915527344,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.08030000329017639,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/motion","display_name":"Motion (physics)","score":0.7225000262260437},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.5461000204086304},{"id":"https://openalex.org/keywords/perspective","display_name":"Perspective (graphical)","score":0.49559998512268066},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.4902999997138977},{"id":"https://openalex.org/keywords/embodied-cognition","display_name":"Embodied cognition","score":0.4618000090122223},{"id":"https://openalex.org/keywords/motion-capture","display_name":"Motion capture","score":0.3711000084877014},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.3449000120162964}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.746399998664856},{"id":"https://openalex.org/C104114177","wikidata":"https://www.wikidata.org/wiki/Q79782","display_name":"Motion (physics)","level":2,"score":0.7225000262260437},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6365000009536743},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.5461000204086304},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.49559998512268066},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.4902999997138977},{"id":"https://openalex.org/C100609095","wikidata":"https://www.wikidata.org/wiki/Q1335050","display_name":"Embodied cognition","level":2,"score":0.4618000090122223},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.413100004196167},{"id":"https://openalex.org/C48007421","wikidata":"https://www.wikidata.org/wiki/Q676252","display_name":"Motion capture","level":3,"score":0.3711000084877014},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.3449000120162964},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.3443000018596649},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3292999863624573},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.32820001244544983},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3237999975681305},{"id":"https://openalex.org/C2983448237","wikidata":"https://www.wikidata.org/wiki/Q1078276","display_name":"Language understanding","level":2,"score":0.3149999976158142},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.304500013589859},{"id":"https://openalex.org/C146159030","wikidata":"https://www.wikidata.org/wiki/Q7625099","display_name":"Structure from motion","level":3,"score":0.2865000069141388},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.27889999747276306},{"id":"https://openalex.org/C207347870","wikidata":"https://www.wikidata.org/wiki/Q371174","display_name":"Gesture","level":2,"score":0.2565999925136566},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.2531999945640564}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2607.07001","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.07001","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2607.07001","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.07001","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Anticipating":[0],"human":[1],"motion":[2,48,69,94,197,200,203,220],"from":[3],"an":[4],"egocentric":[5,34,113],"perspective":[6],"is":[7,95,225],"fundamental":[8],"for":[9],"proactive":[10],"assistance":[11],"in":[12,89,127,137,165],"AR/VR,":[13],"human-robot":[14],"collaboration,":[15],"and":[16,42,50,53,74,81,83,112,124,135,143,169,176,202,210,217],"embodied":[17],"AI.":[18],"While":[19],"recent":[20],"works":[21],"incorporate":[22],"language":[23,54,84],"as":[24,56],"a":[25,90,128,148,166],"semantic":[26,43,75,100],"prior":[27],"to":[28,98,140],"reduce":[29],"the":[30,39,78,99,186],"ill-posed":[31],"nature":[32],"of":[33,77,102],"forecasting,":[35],"they":[36],"largely":[37],"neglect":[38],"3D":[40,79,109,207],"spatial":[41,73],"context":[44],"that":[45,179,190,206],"governs":[46],"how":[47],"unfolds,":[49],"treat":[51],"pose":[52,82],"prediction":[55,213],"separate":[57],"inference":[58],"streams.":[59],"We":[60,146],"introduce":[61],"Ego3DLM,":[62],"built":[63],"on":[64,185],"two":[65],"core":[66],"principles:":[67],"accurate":[68],"forecasting":[70],"requires":[71],"explicit":[72],"understanding":[76],"environment,":[80],"must":[85],"be":[86],"predicted":[87,133],"holistically":[88],"single":[91,129,167],"pass,":[92,131],"since":[93],"inherently":[96],"tied":[97],"interpretation":[101],"actions":[103],"being":[104],"performed.":[105],"Given":[106],"three-point":[107],"tracking,":[108,201],"scene":[110,154,208],"features,":[111],"video,":[114],"Ego3DLM":[115,191],"simultaneously":[116],"decodes":[117],"past":[118,122,199],"pose,":[119,121],"future":[120,125,196],"narration,":[123],"narration":[126],"autoregressive":[130],"grounding":[132,209],"poses":[134],"descriptions":[136],"one":[138],"another":[139],"enforce":[141],"cross-modal":[142,212],"temporal":[144],"consistency.":[145],"adopt":[147],"three-stage":[149],"training":[150],"scheme:":[151],"(1)":[152],"spatial-semantic":[153],"awareness":[155],"pretraining;":[156],"(2)":[157],"holistic":[158,211],"instruction":[159],"tuning":[160],"over":[161],"all":[162],"four":[163],"outputs":[164],"pass;":[168],"(3)":[170],"GRPO-based":[171],"reinforcement":[172],"finetuning":[173],"with":[174],"intra-":[175],"inter-modal":[177],"rewards":[178],"directly":[180],"optimize":[181],"pose-language":[182],"fidelity.":[183],"Experiments":[184],"Nymeria":[187],"benchmark":[188],"demonstrate":[189],"achieves":[192],"state-of-the-art":[193],"performance":[194],"across":[195],"prediction,":[198],"description,":[204],"showing":[205],"yield":[214],"physically":[215],"plausible":[216],"semantically":[218],"coherent":[219],"forecasts.":[221],"The":[222],"project":[223],"page":[224],"available":[226],"at":[227],"https://jaewoo97.github.io/Ego3DLM/.":[228]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-10T00:00:00"}
