{"id":"https://openalex.org/W7165727842","doi":"https://doi.org/10.48550/arxiv.2606.24622","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","display_name":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","publication_year":2026,"publication_date":"2026-06-23","ids":{"openalex":"https://openalex.org/W7165727842","doi":"https://doi.org/10.48550/arxiv.2606.24622"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.24622","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24622","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.24622","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137518500","display_name":"Andreas Chouliaras","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chouliaras, Andreas","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137590785","display_name":"Luke Connolly","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Connolly, Luke","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139276371","display_name":"Dimitris Chatzpoulos","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chatzpoulos, Dimitris","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.4885999858379364,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.4885999858379364,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.16459999978542328,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.08250000327825546,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8465999960899353},{"id":"https://openalex.org/keywords/transparency","display_name":"Transparency (behavior)","score":0.6376000046730042},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.5254999995231628},{"id":"https://openalex.org/keywords/signal","display_name":"SIGNAL (programming language)","score":0.30959999561309814},{"id":"https://openalex.org/keywords/human-behavior","display_name":"Human behavior","score":0.29019999504089355}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8465999960899353},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7271999716758728},{"id":"https://openalex.org/C2780233690","wikidata":"https://www.wikidata.org/wiki/Q535347","display_name":"Transparency (behavior)","level":2,"score":0.6376000046730042},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.5254999995231628},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.484499990940094},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4715999960899353},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3619000017642975},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.30959999561309814},{"id":"https://openalex.org/C117035363","wikidata":"https://www.wikidata.org/wiki/Q3769299","display_name":"Human behavior","level":2,"score":0.29019999504089355},{"id":"https://openalex.org/C2780626000","wikidata":"https://www.wikidata.org/wiki/Q5936775","display_name":"Human-in-the-loop","level":2,"score":0.2727999985218048},{"id":"https://openalex.org/C2987082051","wikidata":"https://www.wikidata.org/wiki/Q223642","display_name":"Human interaction","level":2,"score":0.2574000060558319},{"id":"https://openalex.org/C47932503","wikidata":"https://www.wikidata.org/wiki/Q5395689","display_name":"Error-driven learning","level":3,"score":0.2533000111579895}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.24622","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24622","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.24622","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.24622","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Training":[0],"safe":[1],"Reinforcement":[2,58],"Learning":[3,59],"(RL)":[4],"systems":[5],"is":[6,71,116],"inherently":[7],"challenging,":[8],"with":[9],"no":[10,38],"guarantee":[11],"of":[12],"avoiding":[13],"unwanted":[14],"behaviors.":[15],"The":[16],"most":[17],"effective":[18],"defenses":[19],"against":[20],"this":[21],"are":[22],"(i)":[23],"transparency":[24],"through":[25],"explainability":[26],"and":[27,54,70,79,112,119],"(ii)":[28],"alignment":[29],"via":[30],"human":[31,100,110],"feedback.":[32],"While":[33],"both":[34],"show":[35,83,132],"promising":[36],"results,":[37],"publicly":[39],"available":[40],"framework":[41,56],"currently":[42],"combines":[43],"them.":[44],"To":[45],"address":[46],"this,":[47],"we":[48],"introduce":[49],"Themis,":[50],"an":[51],"XAI-enabled":[52],"testing":[53],"evaluation":[55],"for":[57,74,108],"from":[60],"Human":[61],"Feedback.":[62],"Themis":[63,85,133],"supports":[64,120],"over":[65],"200":[66],"widely":[67],"used":[68],"environments":[69],"easily":[72],"configurable":[73],"experiments":[75,126,141],"in":[76,139],"RL,":[77],"transparency,":[78],"alignment.":[80],"Our":[81],"results":[82],"that":[84,90],"can":[86,134],"train":[87],"reward":[88,97],"models":[89],"match":[91],"or":[92],"outperform":[93],"the":[94],"environment's":[95],"true":[96],"signal":[98],"using":[99],"preferences.":[101],"We":[102],"also":[103],"provide":[104],"a":[105,143],"cloud-based":[106],"platform":[107],"collecting":[109],"feedback":[111],"managing":[113],"experiments.":[114],"It":[115],"user-friendly,":[117],"auto-scalable,":[118],"large":[121],"participant":[122],"groups":[123],"across":[124],"multiple":[125],"without":[127],"extra":[128],"development":[129],"overhead.":[130],"Tests":[131],"support":[135],"one":[136],"thousand":[137],"users":[138],"back-to-back":[140],"on":[142],"modest":[144],"commercial":[145],"machine.":[146]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-25T00:00:00"}
