{"id":"https://openalex.org/W7160946328","doi":"https://doi.org/10.48550/arxiv.2605.09217","title":"Learning the Preferences of a Learning Agent","display_name":"Learning the Preferences of a Learning Agent","publication_year":2026,"publication_date":"2026-05-09","ids":{"openalex":"https://openalex.org/W7160946328","doi":"https://doi.org/10.48550/arxiv.2605.09217"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.09217","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09217","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.09217","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5120440466","display_name":"Karim Abdel Sadek","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sadek, Karim Abdel","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135982465","display_name":"Mark Bedaywi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bedaywi, Mark","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135927310","display_name":"Rhys Gould","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gould, Rhys","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5135957493","display_name":"Stuart Russell","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Russell, Stuart","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.43849998712539673,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.43849998712539673,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.2919999957084656,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12814","display_name":"Gaussian Processes and Bayesian Inference","score":0.02850000001490116,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/preference-learning","display_name":"Preference learning","score":0.7282000184059143},{"id":"https://openalex.org/keywords/preference","display_name":"Preference","score":0.6291000247001648},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6223999857902527},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.5473999977111816},{"id":"https://openalex.org/keywords/active-learning","display_name":"Active learning (machine learning)","score":0.4025999903678894},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.3813000023365021},{"id":"https://openalex.org/keywords/error-driven-learning","display_name":"Error-driven learning","score":0.3765999972820282}],"concepts":[{"id":"https://openalex.org/C181204326","wikidata":"https://www.wikidata.org/wiki/Q7239820","display_name":"Preference learning","level":3,"score":0.7282000184059143},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.6291000247001648},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6223999857902527},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5954999923706055},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5508999824523926},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.5473999977111816},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.4025999903678894},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.3813000023365021},{"id":"https://openalex.org/C47932503","wikidata":"https://www.wikidata.org/wiki/Q5395689","display_name":"Error-driven learning","level":3,"score":0.3765999972820282},{"id":"https://openalex.org/C12298181","wikidata":"https://www.wikidata.org/wiki/Q7246814","display_name":"Proactive learning","level":5,"score":0.36010000109672546},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.3474999964237213},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3066999912261963},{"id":"https://openalex.org/C37228920","wikidata":"https://www.wikidata.org/wiki/Q1307600","display_name":"Experiential learning","level":2,"score":0.28700000047683716},{"id":"https://openalex.org/C24138899","wikidata":"https://www.wikidata.org/wiki/Q17141258","display_name":"Instance-based learning","level":3,"score":0.262800008058548},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.26100000739097595},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.25429999828338623},{"id":"https://openalex.org/C2986563244","wikidata":"https://www.wikidata.org/wiki/Q6822310","display_name":"Learning to learn","level":2,"score":0.250900000333786}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.09217","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09217","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.09217","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09217","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"For":[0],"AI":[1],"systems":[2],"to":[3,6,32,48,66,96,120],"be":[4,49,64],"useful":[5],"humans,":[7],"they":[8],"must":[9],"understand":[10],"and":[11,18,94],"act":[12,67],"in":[13,57,69],"accordance":[14],"with":[15],"our":[16],"values":[17],"preferences.":[19],"Since":[20],"specifying":[21],"preferences":[22,39,82],"is":[23,53],"a":[24,54,84,87,90],"hard":[25],"task,":[26],"inverse":[27],"reinforcement":[28],"learning":[29,65,80,85,139],"(IRL)":[30],"aims":[31],"develop":[33],"methods":[34],"that":[35,144],"allow":[36],"for":[37,136],"inferring":[38],"from":[40],"observed":[41],"behavior.":[42],"However,":[43],"IRL":[44],"assumes":[45],"the":[46,60,77,81,98,107,111],"human":[47,61],"approximately":[50],"optimal.":[51],"This":[52],"big":[55],"limitation":[56],"cases":[58],"where":[59],"themselves":[62],"may":[63],"optimally":[68],"an":[70,121],"environment.":[71],"In":[72,127],"this":[73],"paper,":[74],"we":[75,132],"formalize":[76],"problem":[78],"of":[79,83,129],"agent:":[86],"predictor":[88],"observes":[89],"learner":[91,112],"acting":[92],"online":[93],"tries":[95],"infer":[97],"underlying":[99],"reward":[100],"function":[101],"being":[102,115],"(initially":[103],"suboptimally)":[104],"optimized":[105],"by":[106],"learner.":[108],"We":[109],"model":[110],"as":[113,118],"either":[114],"no-regret,":[116],"or":[117,141],"converging":[119],"optimal":[122],"Boltzmann":[123],"policy":[124],"over":[125],"time.":[126],"each":[128],"these":[130],"settings,":[131],"establish":[133],"theoretical":[134],"guarantees":[135,146],"various":[137],"preference":[138],"algorithms,":[140],"otherwise":[142],"show":[143],"such":[145],"are":[147],"impossible.":[148]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-13T00:00:00"}
