{"id":"https://openalex.org/W7133304882","doi":"https://doi.org/10.48550/arxiv.2603.00253","title":"CoPeP: Benchmarking Continual Pretraining for Protein Language Models","display_name":"CoPeP: Benchmarking Continual Pretraining for Protein Language Models","publication_year":2026,"publication_date":"2026-02-27","ids":{"openalex":"https://openalex.org/W7133304882","doi":"https://doi.org/10.48550/arxiv.2603.00253"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.00253","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.00253","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.00253","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5005200848","display_name":"Darshan Patil","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Patil, Darshan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5028098383","display_name":"Pranshu Malviya","orcid":"https://orcid.org/0000-0001-5579-4520"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Malviya, Pranshu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082723540","display_name":"Mathieu Reymond","orcid":"https://orcid.org/0000-0002-6735-6752"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Reymond, Mathieu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128019515","display_name":"Quentin Fournier","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fournier, Quentin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5127991844","display_name":"Sarath Chandar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chandar, Sarath","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12254","display_name":"Machine Learning in Bioinformatics","score":0.6965000033378601,"subfield":{"id":"https://openalex.org/subfields/1312","display_name":"Molecular Biology"},"field":{"id":"https://openalex.org/fields/13","display_name":"Biochemistry, Genetics and Molecular Biology"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},"topics":[{"id":"https://openalex.org/T12254","display_name":"Machine Learning in Bioinformatics","score":0.6965000033378601,"subfield":{"id":"https://openalex.org/subfields/1312","display_name":"Molecular Biology"},"field":{"id":"https://openalex.org/fields/13","display_name":"Biochemistry, Genetics and Molecular Biology"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.05829999968409538,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10211","display_name":"Computational Drug Discovery Methods","score":0.03099999949336052,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/perplexity","display_name":"Perplexity","score":0.8637999892234802},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.6913999915122986},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.5472999811172485},{"id":"https://openalex.org/keywords/benchmarking","display_name":"Benchmarking","score":0.48660001158714294},{"id":"https://openalex.org/keywords/adept","display_name":"Adept","score":0.4323999881744385},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.40049999952316284},{"id":"https://openalex.org/keywords/scale","display_name":"Scale (ratio)","score":0.36079999804496765},{"id":"https://openalex.org/keywords/uniprot","display_name":"UniProt","score":0.3562000095844269}],"concepts":[{"id":"https://openalex.org/C100279451","wikidata":"https://www.wikidata.org/wiki/Q372193","display_name":"Perplexity","level":3,"score":0.8637999892234802},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.697700023651123},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.6913999915122986},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.6319000124931335},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6270999908447266},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.5472999811172485},{"id":"https://openalex.org/C86251818","wikidata":"https://www.wikidata.org/wiki/Q816754","display_name":"Benchmarking","level":2,"score":0.48660001158714294},{"id":"https://openalex.org/C2776904630","wikidata":"https://www.wikidata.org/wiki/Q356336","display_name":"Adept","level":3,"score":0.4323999881744385},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.40049999952316284},{"id":"https://openalex.org/C2778755073","wikidata":"https://www.wikidata.org/wiki/Q10858537","display_name":"Scale (ratio)","level":2,"score":0.36079999804496765},{"id":"https://openalex.org/C202264299","wikidata":"https://www.wikidata.org/wiki/Q905695","display_name":"UniProt","level":3,"score":0.3562000095844269},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.35569998621940613},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.322299987077713},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.3028999865055084},{"id":"https://openalex.org/C2778112365","wikidata":"https://www.wikidata.org/wiki/Q3511065","display_name":"Sequence (biology)","level":2,"score":0.29670000076293945},{"id":"https://openalex.org/C66153294","wikidata":"https://www.wikidata.org/wiki/Q899291","display_name":"CASP","level":4,"score":0.29339998960494995},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.2892000079154968},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.28690001368522644},{"id":"https://openalex.org/C22019652","wikidata":"https://www.wikidata.org/wiki/Q331309","display_name":"Overfitting","level":3,"score":0.2831999957561493},{"id":"https://openalex.org/C35639132","wikidata":"https://www.wikidata.org/wiki/Q7452468","display_name":"Sequence labeling","level":3,"score":0.27469998598098755},{"id":"https://openalex.org/C2522767166","wikidata":"https://www.wikidata.org/wiki/Q2374463","display_name":"Data science","level":1,"score":0.26409998536109924},{"id":"https://openalex.org/C40506919","wikidata":"https://www.wikidata.org/wiki/Q7452469","display_name":"Sequence learning","level":2,"score":0.257099986076355}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.00253","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.00253","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.00253","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.00253","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","score":0.5138705372810364,"display_name":"Quality Education"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Protein":[0,89],"language":[1],"models":[2,29,155],"(pLMs)":[3],"have":[4,150],"recently":[5],"gained":[6],"significant":[7],"attention":[8],"for":[9,97],"their":[10],"ability":[11],"to":[12,55,67,123,154,172,177,204],"uncover":[13],"relationships":[14],"between":[15],"sequence,":[16],"structure,":[17],"and":[18,43,120,144,156],"function":[19],"from":[20,31,113,136,181],"evolutionary":[21],"statistics,":[22],"thereby":[23],"accelerating":[24],"therapeutic":[25],"drug":[26],"discovery.":[27],"These":[28],"learn":[30],"large":[32],"protein":[33,110,129],"databases":[34],"that":[35,74,164],"are":[36],"continuously":[37],"updated":[38],"by":[39,170],"the":[40,48,59,71,85,114,137],"biology":[41],"community":[42],"whose":[44],"dynamic":[45],"nature":[46],"motivates":[47],"application":[49],"of":[50,70,88,109,148,158],"continual":[51,99,138,190,195],"learning,":[52],"not":[53],"only":[54],"keep":[56],"up":[57,171],"with":[58],"ever-growing":[60],"data,":[61],"but":[62],"also":[63],"as":[64],"an":[65,201,211],"opportunity":[66,203],"take":[68],"advantage":[69],"temporal":[72,166],"meta-information":[73,167],"is":[75],"created":[76],"during":[77],"this":[78,159],"process.":[79],"As":[80],"a":[81,94,107,118],"result,":[82],"we":[83,105],"introduce":[84],"Continual":[86],"Pretraining":[87],"Language":[90],"Models":[91],"(CoPeP)":[92],"benchmark,":[93],"novel":[95],"benchmark":[96,199],"evaluating":[98],"learning":[100,139,191],"approaches":[101],"on":[102,179],"pLMs.":[103],"Specifically,":[104],"curate":[106],"sequence":[108],"datasets":[111],"derived":[112],"UniProt":[115],"Knowledgebase":[116],"spanning":[117],"decade":[119],"define":[121],"metrics":[122],"assess":[124],"pLM":[125],"performance":[126],"across":[127],"31":[128],"understanding":[130],"tasks.":[131],"We":[132],"evaluate":[133],"several":[134,189],"methods":[135,192,207],"literature,":[140],"including":[141],"replay,":[142],"unlearning,":[143],"plasticity-based":[145],"methods,":[146],"some":[147],"which":[149],"never":[151],"been":[152],"applied":[153],"data":[157,180],"scale.":[160],"Our":[161],"findings":[162],"reveal":[163],"incorporating":[165],"improves":[168],"perplexity":[169],"7%":[173],"even":[174,186],"when":[175],"compared":[176],"training":[178],"all":[182],"tasks":[183],"jointly.":[184],"Moreover,":[185],"at":[187,208],"scale,":[188],"outperform":[193],"naive":[194],"pretraining.":[196],"The":[197],"CoPeP":[198],"offers":[200],"exciting":[202],"study":[205],"these":[206],"scale":[209],"in":[210],"impactful":[212],"real-world":[213],"application.":[214]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-04T00:00:00"}
