{"id":"https://openalex.org/W3004806417","doi":"https://doi.org/10.5555/2503308.2503360","title":"Exploration in relational domains for model-based reinforcement learning","display_name":"Exploration in relational domains for model-based reinforcement learning","publication_year":2012,"publication_date":"2012-12-01","ids":{"openalex":"https://openalex.org/W3004806417","doi":"https://doi.org/10.5555/2503308.2503360","mag":"3004806417"},"language":"en","primary_location":{"id":"mag:3004806417","is_oa":false,"landing_page_url":"https://dl.acm.org/doi/10.5555/2503308.2503360","pdf_url":null,"source":{"id":"https://openalex.org/S118988714","display_name":"Journal of Machine Learning Research","issn_l":"1532-4435","issn":["1532-4435","1533-7928"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310315718","host_organization_name":"The MIT Press","host_organization_lineage":["https://openalex.org/P4310315718","https://openalex.org/P4310316440"],"host_organization_lineage_names":["The MIT Press","Massachusetts Institute of Technology"],"type":"journal"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":"Journal of Machine Learning Research","raw_type":null},"type":"article","indexed_in":[],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5028423296","display_name":"LangTobias","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"LangTobias","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5010383943","display_name":"ToussaintMarc","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"ToussaintMarc","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5023647314","display_name":"KerstingKristian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"KerstingKristian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.66397576,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10260","display_name":"Software Engineering Research","score":0.8120999932289124,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10260","display_name":"Software Engineering Research","score":0.8120999932289124,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8050000071525574,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T14351","display_name":"Statistical and Computational Modeling","score":0.7958999872207642,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6607153415679932},{"id":"https://openalex.org/keywords/statistical-relational-learning","display_name":"Statistical relational learning","score":0.6549115180969238},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.5683425664901733},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4984431266784668},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.37553671002388},{"id":"https://openalex.org/keywords/relational-database","display_name":"Relational database","score":0.27064305543899536},{"id":"https://openalex.org/keywords/data-mining","display_name":"Data mining","score":0.16030913591384888}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6607153415679932},{"id":"https://openalex.org/C177877439","wikidata":"https://www.wikidata.org/wiki/Q7604413","display_name":"Statistical relational learning","level":3,"score":0.6549115180969238},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5683425664901733},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4984431266784668},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.37553671002388},{"id":"https://openalex.org/C5655090","wikidata":"https://www.wikidata.org/wiki/Q192588","display_name":"Relational database","level":2,"score":0.27064305543899536},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.16030913591384888}],"mesh":[],"locations_count":1,"locations":[{"id":"mag:3004806417","is_oa":false,"landing_page_url":"https://dl.acm.org/doi/10.5555/2503308.2503360","pdf_url":null,"source":{"id":"https://openalex.org/S118988714","display_name":"Journal of Machine Learning Research","issn_l":"1532-4435","issn":["1532-4435","1533-7928"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310315718","host_organization_name":"The MIT Press","host_organization_lineage":["https://openalex.org/P4310315718","https://openalex.org/P4310316440"],"host_organization_lineage_names":["The MIT Press","Massachusetts Institute of Technology"],"type":"journal"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":"Journal of Machine Learning Research","raw_type":null}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Decent work and economic growth","id":"https://metadata.un.org/sdg/8","score":0.5}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":["https://openalex.org/W2495039199","https://openalex.org/W2071574916","https://openalex.org/W2519090662","https://openalex.org/W115717799","https://openalex.org/W3185313117","https://openalex.org/W192868579","https://openalex.org/W347445721","https://openalex.org/W1769424140","https://openalex.org/W3033717640","https://openalex.org/W2978070926","https://openalex.org/W106493965","https://openalex.org/W2975874528","https://openalex.org/W213343370","https://openalex.org/W1783281017","https://openalex.org/W55370350","https://openalex.org/W2979592121","https://openalex.org/W2301341004","https://openalex.org/W2367922714","https://openalex.org/W3081310128","https://openalex.org/W2951104138"],"abstract_inverted_index":{"A":[0],"fundamental":[1],"problem":[2,14],"in":[3,15,22],"reinforcement":[4,20],"learning":[5,21],"is":[6],"balancing":[7],"exploration":[8],"and":[9],"exploitation.":[10],"We":[11],"address":[12],"this":[13],"the":[16],"context":[17],"of":[18],"model-based":[19],"large":[23],"stochastic":[24],"relationa...":[25]},"counts_by_year":[],"updated_date":"2026-08-15T07:11:24.734988","created_date":"2025-10-10T00:00:00"}
