{"id":"https://openalex.org/W7166852105","doi":"https://doi.org/10.18653/v1/2026.acl-long.2024","title":"MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization","display_name":"MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166852105","doi":"https://doi.org/10.18653/v1/2026.acl-long.2024"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.2024","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.2024","pdf_url":"https://aclanthology.org/2026.acl-long.2024.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.2024.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139779833","display_name":"Ziqing Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ziqing Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139732308","display_name":"Yibo Wen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yibo Wen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139840599","display_name":"Abhishek Pandey","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Abhishek Pandey","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139759083","display_name":"Han Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Han Liu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139730413","display_name":"Kaize Ding","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kaize Ding","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.90797546,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"43694","last_page":"43712"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11948","display_name":"Machine Learning in Materials Science","score":0.1388999968767166,"subfield":{"id":"https://openalex.org/subfields/2505","display_name":"Materials Chemistry"},"field":{"id":"https://openalex.org/fields/25","display_name":"Materials Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11948","display_name":"Machine Learning in Materials Science","score":0.1388999968767166,"subfield":{"id":"https://openalex.org/subfields/2505","display_name":"Materials Chemistry"},"field":{"id":"https://openalex.org/fields/25","display_name":"Materials Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.12129999697208405,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10100","display_name":"Metaheuristic Optimization Algorithms Research","score":0.07490000128746033,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5175999999046326},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.32760000228881836},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.3181999921798706},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.30379998683929443},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.2892000079154968},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.2782000005245209}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5175999999046326},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.49950000643730164},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4618000090122223},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.32760000228881836},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.3181999921798706},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.30379998683929443},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.2892000079154968},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2782000005245209},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.2727000117301941},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.27129998803138733},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.27079999446868896},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2612999975681305},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.26010000705718994},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.2572000026702881}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.2024","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.2024","pdf_url":"https://aclanthology.org/2026.acl-long.2024.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.2024","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.2024","pdf_url":"https://aclanthology.org/2026.acl-long.2024.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320309480","display_name":"Nvidia","ror":"https://ror.org/03jdj4y14"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166852105.pdf","grobid_xml":"https://content.openalex.org/works/W7166852105.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"In":[0],"drug":[1],"discovery,":[2],"molecular":[3,14],"optimization":[4,87],"aims":[5],"to":[6,12,20,55,106,117],"iteratively":[7],"refine":[8],"a":[9,32,39,90,98],"lead":[10],"compound":[11],"improve":[13],"properties":[15],"while":[16,48],"preserving":[17],"structural":[18],"similarity":[19],"the":[21,130,158],"original":[22],"molecule.However,":[23],"each":[24],"oracle":[25,41,46,169],"evaluation":[26],"is":[27,67],"expensive,":[28],"making":[29],"sample":[30],"efficiency":[31],"key":[33,64],"challenge":[34],"for":[35,78,110],"existing":[36],"methods":[37,49],"under":[38],"limited":[40],"budget.Trial-and-error":[42],"approaches":[43],"require":[44],"many":[45],"calls,":[47],"that":[50,70,142,148],"leverage":[51],"external":[52],"knowledge":[53,141],"tend":[54],"reuse":[56],"familiar":[57],"templates":[58],"and":[59,74,113,161],"struggle":[60],"on":[61,124,153,163],"challenging":[62],"objectives.A":[63],"missing":[65],"piece":[66],"long-term":[68,140],"memory":[69],"can":[71],"ground":[72],"decisions":[73],"provide":[75],"reusable":[76,122],"insights":[77],"future":[79,144],"optimizations.To":[80],"address":[81],"this,":[82],"we":[83,128],"present":[84],"MolMem":[85,101,149],"(Molecular":[86],"with":[88,97,132],"Memory),":[89],"multi-turn":[91],"agentic":[92],"reinforcement":[93],"learning":[94],"(RL)":[95],"framework":[96],"dualmemory":[99],"system.Specifically,":[100],"uses":[102],"Static":[103],"Exemplar":[104],"Memory":[105,116],"retrieve":[107],"relevant":[108],"exemplars":[109],"cold-start":[111],"grounding,":[112],"Evolving":[114],"Skill":[115],"distill":[118],"successful":[119],"trajectories":[120],"into":[121,139],"strategies.Built":[123],"this":[125],"memory-augmented":[126],"formulation,":[127],"train":[129],"policy":[131],"dense":[133],"step-wise":[134],"rewards,":[135],"turning":[136],"costly":[137],"rollouts":[138],"improves":[143],"optimization.Extensive":[145],"experiments":[146],"show":[147],"achieves":[150],"90%":[151],"success":[152],"single-property":[154],"tasks":[155,165],"(1.5\u00d7":[156],"over":[157],"best":[159],"baseline)":[160],"52%":[162],"multi-property":[164],"using":[166],"only":[167],"500":[168],"calls.":[170]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
