{"id":"https://openalex.org/W7153190824","doi":"https://doi.org/10.48550/arxiv.2604.07526","title":"From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference","display_name":"From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference","publication_year":2026,"publication_date":"2026-04-08","ids":{"openalex":"https://openalex.org/W7153190824","doi":"https://doi.org/10.48550/arxiv.2604.07526"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.07526","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.07526","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.07526","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5133376593","display_name":"Ravindra Ganti","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ganti, Ravindra","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133380742","display_name":"Steve Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xu, Steve","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.4505999982357025,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10904","display_name":"Embedded Systems Design Techniques","score":0.4505999982357025,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.3160000145435333,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T14347","display_name":"Big Data and Digital Economy","score":0.043699998408555984,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/application-specific-integrated-circuit","display_name":"Application-specific integrated circuit","score":0.7623999714851379},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.6531999707221985},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5400000214576721},{"id":"https://openalex.org/keywords/dram","display_name":"Dram","score":0.5281999707221985},{"id":"https://openalex.org/keywords/workload","display_name":"Workload","score":0.487199991941452},{"id":"https://openalex.org/keywords/compiler","display_name":"Compiler","score":0.47429999709129333},{"id":"https://openalex.org/keywords/markov-chain","display_name":"Markov chain","score":0.4375999867916107}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8100000023841858},{"id":"https://openalex.org/C77390884","wikidata":"https://www.wikidata.org/wiki/Q217302","display_name":"Application-specific integrated circuit","level":2,"score":0.7623999714851379},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.6531999707221985},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5400000214576721},{"id":"https://openalex.org/C7366592","wikidata":"https://www.wikidata.org/wiki/Q1255620","display_name":"Dram","level":2,"score":0.5281999707221985},{"id":"https://openalex.org/C2778476105","wikidata":"https://www.wikidata.org/wiki/Q628539","display_name":"Workload","level":2,"score":0.487199991941452},{"id":"https://openalex.org/C169590947","wikidata":"https://www.wikidata.org/wiki/Q47506","display_name":"Compiler","level":2,"score":0.47429999709129333},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.4375999867916107},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.42739999294281006},{"id":"https://openalex.org/C118524514","wikidata":"https://www.wikidata.org/wiki/Q173212","display_name":"Computer architecture","level":1,"score":0.41749998927116394},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.4032000005245209},{"id":"https://openalex.org/C123657996","wikidata":"https://www.wikidata.org/wiki/Q12271","display_name":"Architecture","level":2,"score":0.38499999046325684},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.3849000036716461},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3776000142097473},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.37380000948905945},{"id":"https://openalex.org/C149635348","wikidata":"https://www.wikidata.org/wiki/Q193040","display_name":"Embedded system","level":1,"score":0.34549999237060547},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.3237999975681305},{"id":"https://openalex.org/C17020691","wikidata":"https://www.wikidata.org/wiki/Q139677","display_name":"Operator (biology)","level":5,"score":0.3102000057697296},{"id":"https://openalex.org/C113775141","wikidata":"https://www.wikidata.org/wiki/Q428691","display_name":"Computer engineering","level":1,"score":0.30640000104904175},{"id":"https://openalex.org/C18555067","wikidata":"https://www.wikidata.org/wiki/Q8375051","display_name":"Joint (building)","level":2,"score":0.2842000126838684},{"id":"https://openalex.org/C115903868","wikidata":"https://www.wikidata.org/wiki/Q80993","display_name":"Software engineering","level":1,"score":0.2720000147819519},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2581000030040741},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.25699999928474426},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.07526","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.07526","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.07526","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.07526","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"We":[0,61],"present":[1],"an":[2],"RL-driven":[3],"compiler":[4],"that":[5],"jointly":[6],"optimizes":[7],"ASIC":[8],"architecture,":[9],"memory":[10,109],"hierarchy,":[11],"and":[12,37,58,78,101,108],"workload":[13],"partitioning":[14],"for":[15],"AI":[16],"inference":[17],"across":[18],"3nm":[19],"to":[20],"28nm.":[21],"The":[22],"design":[23],"space":[24,52],"is":[25],"formulated":[26],"as":[27],"a":[28,38],"single":[29],"Markov":[30],"Decision":[31],"Process":[32],"with":[33,46],"mixed":[34],"discrete-continuous":[35],"actions":[36],"unified":[39],"Power-Performance-Area":[40],"(PPA)":[41],"objective.":[42],"Soft":[43],"Actor-Critic":[44],"(SAC)":[45],"Mixture-of-Experts":[47],"gating":[48],"explores":[49],"the":[50,95],"joint":[51],"of":[53],"mesh":[54,99],"topology,":[55],"per-core":[56],"microarchitecture,":[57],"operator":[59],"placement.":[60],"validate":[62],"on":[63],"two":[64],"workloads,":[65],"Llama":[66],"3.1":[67],"8B":[68],"FP16":[69],"(high-performance":[70],"mode,":[71,81],"29809":[72],"tokens":[73],"per":[74],"second":[75],"at":[76,86],"3nm)":[77],"SmolVLM":[79],"(low-power":[80],"less":[82],"than":[83],"13":[84],"mW":[85],"all":[87],"nodes,":[88,94],"10":[89],"MHz).":[90],"Across":[91],"7":[92],"process":[93],"RL":[96],"automatically":[97],"adapts":[98],"sizes":[100],"per-tile":[102],"configurations,":[103],"including":[104],"heterogeneous":[105],"FETCH,":[106],"VLEN,":[107],"allocation":[110],"without":[111],"node-specific":[112],"manual":[113],"retuning.":[114]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-04-11T00:00:00"}
