{"id":"https://openalex.org/W4416790777","doi":"https://doi.org/10.14428/esann/2026.es2026-114","title":"Hybrid-AIRL: Enhancing Inverse Reinforcement Learning with Supervised Expert Guidance","display_name":"Hybrid-AIRL: Enhancing Inverse Reinforcement Learning with Supervised Expert Guidance","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W4416790777","doi":"https://doi.org/10.14428/esann/2026.es2026-114"},"language":null,"primary_location":{"id":"doi:10.14428/esann/2026.es2026-114","is_oa":true,"landing_page_url":"https://doi.org/10.14428/esann/2026.es2026-114","pdf_url":"https://doi.org/10.14428/esann/2026.es2026-114","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ESANN 2026 proceesdings","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["arxiv","crossref","datacite"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.14428/esann/2026.es2026-114","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5120389616","display_name":"Bram Silue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bram Silue","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5120389617","display_name":"Santiago Amaya-Corredor","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Santiago Amaya-Corredor","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5046330057","display_name":"Patrick Mannion","orcid":"https://orcid.org/0000-0002-7951-878X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Patrick Mannion","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5071412227","display_name":"Lander Willem","orcid":"https://orcid.org/0000-0002-9210-1196"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lander Willem","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5068276498","display_name":"Pieter Libin","orcid":"https://orcid.org/0000-0003-3906-758X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pieter Libin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"583","last_page":"588"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.44699999690055847,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.44699999690055847,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.15680000185966492,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.05000000074505806,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6873999834060669},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.5494999885559082},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.4636000096797943},{"id":"https://openalex.org/keywords/supervised-learning","display_name":"Supervised learning","score":0.4602999985218048},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.45100000500679016},{"id":"https://openalex.org/keywords/regularization","display_name":"Regularization (linguistics)","score":0.4011000096797943},{"id":"https://openalex.org/keywords/adversarial-system","display_name":"Adversarial system","score":0.3880000114440918},{"id":"https://openalex.org/keywords/semi-supervised-learning","display_name":"Semi-supervised learning","score":0.3878999948501587}],"concepts":[{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.7059999704360962},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6873999834060669},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6758000254631042},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6592000126838684},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.5494999885559082},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.4636000096797943},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.4602999985218048},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.45100000500679016},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.4011000096797943},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.3880000114440918},{"id":"https://openalex.org/C58973888","wikidata":"https://www.wikidata.org/wiki/Q1041418","display_name":"Semi-supervised learning","level":2,"score":0.3878999948501587},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.34769999980926514},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.33739998936653137},{"id":"https://openalex.org/C151201525","wikidata":"https://www.wikidata.org/wiki/Q177239","display_name":"Limit (mathematics)","level":2,"score":0.29820001125335693},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.29249998927116394},{"id":"https://openalex.org/C181204326","wikidata":"https://www.wikidata.org/wiki/Q7239820","display_name":"Preference learning","level":3,"score":0.27869999408721924},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.2743000090122223},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.26980000734329224},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.26429998874664307},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.2565000057220459},{"id":"https://openalex.org/C207685749","wikidata":"https://www.wikidata.org/wiki/Q2088941","display_name":"Domain knowledge","level":2,"score":0.2551000118255615}],"mesh":[],"locations_count":3,"locations":[{"id":"doi:10.14428/esann/2026.es2026-114","is_oa":true,"landing_page_url":"https://doi.org/10.14428/esann/2026.es2026-114","pdf_url":"https://doi.org/10.14428/esann/2026.es2026-114","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ESANN 2026 proceesdings","raw_type":"proceedings-article"},{"id":"pmh:oai:arXiv.org:2511.21356","is_oa":true,"landing_page_url":"https://arxiv.org/abs/2511.21356","pdf_url":"https://arxiv.org/pdf/2511.21356","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2511.21356","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2511.21356","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.14428/esann/2026.es2026-114","is_oa":true,"landing_page_url":"https://doi.org/10.14428/esann/2026.es2026-114","pdf_url":"https://doi.org/10.14428/esann/2026.es2026-114","source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"ESANN 2026 proceesdings","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G2716480863","display_name":"Public health decision making with stochastic individual-based models: a translational framework driven by advances in health economics, model inference and reinforcement learning (ACCELERATE)","funder_award_id":"G059423N","funder_id":"https://openalex.org/F4320321730","funder_display_name":"Fonds Wetenschappelijk Onderzoek"},{"id":"https://openalex.org/G4758198678","display_name":null,"funder_award_id":"OZR3863BOF","funder_id":"https://openalex.org/F4320322634","funder_display_name":"Vrije Universiteit Brussel"}],"funders":[{"id":"https://openalex.org/F4320319128","display_name":"Vlaams Supercomputer Centrum","ror":null},{"id":"https://openalex.org/F4320321730","display_name":"Fonds Wetenschappelijk Onderzoek","ror":"https://ror.org/03qtxy027"},{"id":"https://openalex.org/F4320322634","display_name":"Vrije Universiteit Brussel","ror":"https://ror.org/006e5kg04"},{"id":"https://openalex.org/F4320327336","display_name":"Vlaamse regering","ror":null}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4416790777.pdf","grobid_xml":"https://content.openalex.org/works/W4416790777.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Adversarial":[0,161],"Inverse":[1,162],"Reinforcement":[2,91,163],"Learning":[3,92,164],"(AIRL)":[4],"addresses":[5],"sparse":[6],"rewards":[7],"by":[8,97],"inferring":[9,98],"dense":[10],"reward":[11,51,99,128,153],"functions":[12,100],"from":[13,61,101],"expert":[14,62,102,116,171],"demonstrations,":[15],"but":[16],"its":[17],"performance":[18],"in":[19,27,88,139],"complex,":[20],"imperfect-information":[21],"settings":[22],"is":[23],"underexplored.We":[24],"evaluate":[25],"AIRL":[26,113,123,136,168],"Heads-Up":[28,140],"Limit":[29,141],"Hold'em":[30,142],"(HULHE)":[31,143],"poker":[32,72],"and":[33,53,64,70,79,111,149,173,178,186],"observe":[34],"that":[35,74,135],"it":[36],"faces":[37,137],"challenges":[38],"producing":[39],"sufficiently":[40],"informative":[41],"rewards.To":[42],"address":[43,156],"this,":[44,157],"we":[45,158],"introduce":[46],"Hybrid-AIRL":[47],"(H-AIRL),":[48,165],"which":[49,166],"improves":[50,76,182],"inference":[52],"policy":[54],"learning":[55],"using":[56],"a":[57,119],"partially":[58],"supervised":[59,86,170],"loss":[60],"data":[63],"stochastic":[65,174],"regularization.Experiments":[66],"on":[67],"Gymnasium":[68,176],"benchmarks":[69,177],"HULHE":[71,179],"show":[73,134],"H-AIRL":[75,181],"sample":[77,184],"efficiency":[78],"training":[80],"stability,":[81,183],"highlighting":[82],"the":[83,187],"value":[84],"of":[85,189],"signals":[87],"inverse":[89],"RL.Inverse":[90],"(IRL)":[93],"offers":[94],"an":[95,126],"alternative":[96],"demonstrations":[103],"[3].and":[104],"adversarial":[105],"methods":[106],"such":[107],"as":[108],"GAIL":[109],"[5]":[110],"later":[112],"[6]":[114],"model":[115],"behavior":[117],"through":[118],"discriminator-policy":[120],"game,":[121],"with":[122,169],"additionally":[124],"recovering":[125],"explicit":[127],"function.Despite":[129],"these":[130],"capabilities,":[131],"our":[132],"experiments":[133],"difficulties":[138],"poker,":[144,180],"where":[145],"large":[146],"state-action":[147],"spaces":[148],"partial":[150],"observability":[151],"hinder":[152],"function":[154],"inference.To":[155],"propose":[159],"Hybrid":[160],"augments":[167],"guidance":[172],"regularization.Across":[175],"efficiency,":[185],"fidelity":[188],"inferred":[190],"rewards.":[191]},"counts_by_year":[],"updated_date":"2026-07-20T07:56:41.581041","created_date":"2025-11-28T00:00:00"}
