{"id":"https://openalex.org/W7127940006","doi":"https://doi.org/10.1145/3748173.3779553","title":"HFRWKV: A High-Performance Fully On-Chip Hardware Accelerator for RWKV","display_name":"HFRWKV: A High-Performance Fully On-Chip Hardware Accelerator for RWKV","publication_year":2026,"publication_date":"2026-02-05","ids":{"openalex":"https://openalex.org/W7127940006","doi":"https://doi.org/10.1145/3748173.3779553"},"language":null,"primary_location":{"id":"doi:10.1145/3748173.3779553","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3748173.3779553","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2026 ACM/SIGDA International Symposium on Field Programmable Gate Arrays","raw_type":"proceedings-article"},"type":"conference-abstract","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://doi.org/10.1145/3748173.3779553","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Shijie Liu","orcid":"https://orcid.org/0009-0002-4755-4839"},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Shijie Liu","raw_affiliation_strings":["Sun Yat-sen University, Guangzhou, China"],"raw_orcid":"https://orcid.org/0009-0002-4755-4839","affiliations":[{"raw_affiliation_string":"Sun Yat-sen University, Guangzhou, China","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5125232233","display_name":"Zhenghao Zeng","orcid":null},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Zhenghao Zeng","raw_affiliation_strings":["Sun Yat-sen University, Guangzhou, China"],"raw_orcid":"https://orcid.org/0009-0007-4549-5173","affiliations":[{"raw_affiliation_string":"Sun Yat-sen University, Guangzhou, China","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5109573014","display_name":"Han Yi Jiao","orcid":null},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Han Jiao","raw_affiliation_strings":["Sun Yat-sen University, Guangzhou, China"],"raw_orcid":"https://orcid.org/0009-0003-2021-8015","affiliations":[{"raw_affiliation_string":"Sun Yat-sen University, Guangzhou, China","institution_ids":["https://openalex.org/I157773358"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5125177385","display_name":"Yihua Huang","orcid":null},"institutions":[{"id":"https://openalex.org/I157773358","display_name":"Sun Yat-sen University","ror":"https://ror.org/0064kty71","country_code":"CN","type":"education","lineage":["https://openalex.org/I157773358"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yihua Huang","raw_affiliation_strings":["Sun Yat-sen University, Guangzhou, China"],"raw_orcid":"https://orcid.org/0000-0001-6736-7913","affiliations":[{"raw_affiliation_string":"Sun Yat-sen University, Guangzhou, China","institution_ids":["https://openalex.org/I157773358"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I157773358"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"142","last_page":"142"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.42800000309944153,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.42800000309944153,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12326","display_name":"Network Packet Processing and Optimization","score":0.10480000078678131,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10901","display_name":"Advanced Data Compression Techniques","score":0.09610000252723694,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/throughput","display_name":"Throughput","score":0.6086999773979187},{"id":"https://openalex.org/keywords/lookup-table","display_name":"Lookup table","score":0.5939000248908997},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.5692999958992004},{"id":"https://openalex.org/keywords/efficient-energy-use","display_name":"Efficient energy use","score":0.4690999984741211},{"id":"https://openalex.org/keywords/field-programmable-gate-array","display_name":"Field-programmable gate array","score":0.41339999437332153},{"id":"https://openalex.org/keywords/quantization","display_name":"Quantization (signal processing)","score":0.4124000072479248},{"id":"https://openalex.org/keywords/hardware-acceleration","display_name":"Hardware acceleration","score":0.3864000141620636},{"id":"https://openalex.org/keywords/energy-consumption","display_name":"Energy consumption","score":0.38609999418258667}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7983999848365784},{"id":"https://openalex.org/C157764524","wikidata":"https://www.wikidata.org/wiki/Q1383412","display_name":"Throughput","level":3,"score":0.6086999773979187},{"id":"https://openalex.org/C134835016","wikidata":"https://www.wikidata.org/wiki/Q690265","display_name":"Lookup table","level":2,"score":0.5939000248908997},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.5692999958992004},{"id":"https://openalex.org/C9390403","wikidata":"https://www.wikidata.org/wiki/Q3966","display_name":"Computer hardware","level":1,"score":0.5327000021934509},{"id":"https://openalex.org/C2742236","wikidata":"https://www.wikidata.org/wiki/Q924713","display_name":"Efficient energy use","level":2,"score":0.4690999984741211},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.44850000739097595},{"id":"https://openalex.org/C42935608","wikidata":"https://www.wikidata.org/wiki/Q190411","display_name":"Field-programmable gate array","level":2,"score":0.41339999437332153},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.413100004196167},{"id":"https://openalex.org/C28855332","wikidata":"https://www.wikidata.org/wiki/Q198099","display_name":"Quantization (signal processing)","level":2,"score":0.4124000072479248},{"id":"https://openalex.org/C13164978","wikidata":"https://www.wikidata.org/wiki/Q600158","display_name":"Hardware acceleration","level":3,"score":0.3864000141620636},{"id":"https://openalex.org/C2780165032","wikidata":"https://www.wikidata.org/wiki/Q16869822","display_name":"Energy consumption","level":2,"score":0.38609999418258667},{"id":"https://openalex.org/C45235069","wikidata":"https://www.wikidata.org/wiki/Q278425","display_name":"Table (database)","level":2,"score":0.35690000653266907},{"id":"https://openalex.org/C2778915421","wikidata":"https://www.wikidata.org/wiki/Q3643177","display_name":"Performance improvement","level":2,"score":0.3513000011444092},{"id":"https://openalex.org/C179799912","wikidata":"https://www.wikidata.org/wiki/Q205084","display_name":"Computational complexity theory","level":2,"score":0.30489999055862427},{"id":"https://openalex.org/C17349429","wikidata":"https://www.wikidata.org/wiki/Q1049914","display_name":"Matrix multiplication","level":3,"score":0.2816999852657318},{"id":"https://openalex.org/C186370098","wikidata":"https://www.wikidata.org/wiki/Q442787","display_name":"Energy (signal processing)","level":2,"score":0.2784000039100647},{"id":"https://openalex.org/C142962650","wikidata":"https://www.wikidata.org/wiki/Q240838","display_name":"Reconfigurable computing","level":3,"score":0.26910001039505005},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.262800008058548},{"id":"https://openalex.org/C65232700","wikidata":"https://www.wikidata.org/wiki/Q5656403","display_name":"Hardware architecture","level":3,"score":0.2603999972343445},{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.2540000081062317}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1145/3748173.3779553","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3748173.3779553","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2026 ACM/SIGDA International Symposium on Field Programmable Gate Arrays","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.1145/3748173.3779553","is_oa":true,"landing_page_url":"https://doi.org/10.1145/3748173.3779553","pdf_url":null,"source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2026 ACM/SIGDA International Symposium on Field Programmable Gate Arrays","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"RWKV":[0],"achieves":[1,157],"Transformer-level":[2],"performance":[3,56],"with":[4,77],"linear":[5,82],"memory":[6],"complexity":[7],"for":[8,38],"long":[9],"sequences.":[10],"However,":[11],"its":[12],"inherent":[13],"sequentiality":[14],"limits":[15],"hardware":[16,36,93],"parallelism":[17],"and":[18,67,92,107,113,121,131,147,163],"triggers":[19],"memory-bound":[20],"bottlenecks":[21,120],"via":[22],"frequent":[23],"off-chip":[24],"weight":[25],"accesses.":[26],"To":[27],"address":[28],"these":[29],"challenges,":[30],"we":[31,45,69],"propose":[32,46],"HFRWKV,":[33],"an":[34,148,164],"FPGA-based":[35],"accelerator":[37],"RWKV.":[39],"Within":[40],"the":[41,62,128],"matrix":[42],"operation":[43],"module,":[44],"a":[47,71,98,140,142,158],"novel":[48],"\u0394-PoT":[49],"hardware-friendly":[50],"hybrid-precision":[51],"quantization":[52],"strategy,":[53],"which":[54,84],"enhances":[55],"while":[57],"maintaining":[58],"acceptable":[59],"accuracy.":[60],"For":[61],"complex":[63],"operations":[64],"including":[65],"exponentiation":[66],"division,":[68],"introduce":[70],"method":[72],"featuring":[73],"reusable":[74],"architectures":[75],"combined":[76],"lookup":[78],"tables":[79],"or":[80],"piecewise":[81],"approximation,":[83],"is":[85],"algorithmically":[86],"refined":[87],"to":[88,117,139,155],"effectively":[89],"balance":[90],"precision":[91],"resource":[94],"consumption.":[95],"We":[96,124],"adopt":[97],"fully":[99],"on-chip":[100],"computing":[101],"system":[102],"integrating":[103],"parallel":[104],"matrix-vector":[105],"array":[106],"efficient":[108],"pipelining,":[109],"employing":[110],"computation":[111],"reordering":[112],"chunked":[114],"double":[115],"buffering":[116],"eliminate":[118],"data":[119],"maximize":[122],"throughput.":[123],"implement":[125],"HFRWKV":[126],"on":[127],"Alveo":[129],"U50":[130],"U280":[132],"platform.":[133],"Experimental":[134],"results":[135],"show":[136],"that":[137],"compared":[138],"CPU,":[141],"throughput":[143,159],"improvement":[144,151,160,167],"of":[145,152,161,168],"63.48\u00d7":[146],"energy":[149,165],"efficiency":[150,166],"139.17\u00d7.":[153],"Compared":[154],"GPUs,":[156],"32.33\u00d7":[162],"171.36\u00d7.":[169]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-02-07T00:00:00"}
