{"id":"https://openalex.org/W2912630292","doi":"https://doi.org/10.18653/v1/w18-6120","title":"Word-like character n-gram embedding","display_name":"Word-like character n-gram embedding","publication_year":2018,"publication_date":"2018-01-01","ids":{"openalex":"https://openalex.org/W2912630292","doi":"https://doi.org/10.18653/v1/w18-6120","mag":"2912630292"},"language":"en","primary_location":{"id":"doi:10.18653/v1/w18-6120","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/w18-6120","pdf_url":"https://www.aclweb.org/anthology/W18-6120.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2018 EMNLP Workshop W-NUT: The 4th Workshop on Noisy User-generated Text","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://www.aclweb.org/anthology/W18-6120.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5082063964","display_name":"Geewook Kim","orcid":"https://orcid.org/0009-0001-6713-3858"},"institutions":[{"id":"https://openalex.org/I22299242","display_name":"Kyoto University","ror":"https://ror.org/02kpeqv85","country_code":"JP","type":"education","lineage":["https://openalex.org/I22299242"]},{"id":"https://openalex.org/I4210126580","display_name":"RIKEN Center for Advanced Intelligence Project","ror":"https://ror.org/03ckxwf91","country_code":"JP","type":"facility","lineage":["https://openalex.org/I4210110652","https://openalex.org/I4210126580"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Geewook Kim","raw_affiliation_strings":["Department of Systems Science, Graduate School of Informatics, Kyoto University Mathematical Statistics Team, RIKEN Center for Advanced Intelligence Project"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Systems Science, Graduate School of Informatics, Kyoto University Mathematical Statistics Team, RIKEN Center for Advanced Intelligence Project","institution_ids":["https://openalex.org/I22299242","https://openalex.org/I4210126580"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5035121152","display_name":"Kazuki Fukui","orcid":null},"institutions":[{"id":"https://openalex.org/I22299242","display_name":"Kyoto University","ror":"https://ror.org/02kpeqv85","country_code":"JP","type":"education","lineage":["https://openalex.org/I22299242"]},{"id":"https://openalex.org/I4210126580","display_name":"RIKEN Center for Advanced Intelligence Project","ror":"https://ror.org/03ckxwf91","country_code":"JP","type":"facility","lineage":["https://openalex.org/I4210110652","https://openalex.org/I4210126580"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Kazuki Fukui","raw_affiliation_strings":["Department of Systems Science, Graduate School of Informatics, Kyoto University Mathematical Statistics Team, RIKEN Center for Advanced Intelligence Project"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Systems Science, Graduate School of Informatics, Kyoto University Mathematical Statistics Team, RIKEN Center for Advanced Intelligence Project","institution_ids":["https://openalex.org/I22299242","https://openalex.org/I4210126580"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5012479520","display_name":"Hidetoshi Shimodaira","orcid":"https://orcid.org/0000-0002-3371-7724"},"institutions":[{"id":"https://openalex.org/I22299242","display_name":"Kyoto University","ror":"https://ror.org/02kpeqv85","country_code":"JP","type":"education","lineage":["https://openalex.org/I22299242"]},{"id":"https://openalex.org/I4210126580","display_name":"RIKEN Center for Advanced Intelligence Project","ror":"https://ror.org/03ckxwf91","country_code":"JP","type":"facility","lineage":["https://openalex.org/I4210110652","https://openalex.org/I4210126580"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Hidetoshi Shimodaira","raw_affiliation_strings":["Department of Systems Science, Graduate School of Informatics, Kyoto University Mathematical Statistics Team, RIKEN Center for Advanced Intelligence Project"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Systems Science, Graduate School of Informatics, Kyoto University Mathematical Statistics Team, RIKEN Center for Advanced Intelligence Project","institution_ids":["https://openalex.org/I22299242","https://openalex.org/I4210126580"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":7,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"148","last_page":"152"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.9998999834060669,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11550","display_name":"Text and Document Classification Technologies","score":0.9954000115394592,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8052307367324829},{"id":"https://openalex.org/keywords/character","display_name":"Character (mathematics)","score":0.7556983232498169},{"id":"https://openalex.org/keywords/word","display_name":"Word (group theory)","score":0.7503126859664917},{"id":"https://openalex.org/keywords/natural-language-processing","display_name":"Natural language processing","score":0.6973682641983032},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6568635702133179},{"id":"https://openalex.org/keywords/word-embedding","display_name":"Word embedding","score":0.6398061513900757},{"id":"https://openalex.org/keywords/text-segmentation","display_name":"Text segmentation","score":0.5842185616493225},{"id":"https://openalex.org/keywords/vocabulary","display_name":"Vocabulary","score":0.5205365419387817},{"id":"https://openalex.org/keywords/embedding","display_name":"Embedding","score":0.5005266666412354},{"id":"https://openalex.org/keywords/n-gram","display_name":"n-gram","score":0.4194127023220062},{"id":"https://openalex.org/keywords/speech-recognition","display_name":"Speech recognition","score":0.3724570572376251},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.2852208912372589},{"id":"https://openalex.org/keywords/segmentation","display_name":"Segmentation","score":0.24022555351257324},{"id":"https://openalex.org/keywords/linguistics","display_name":"Linguistics","score":0.1975458860397339},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.12824532389640808}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8052307367324829},{"id":"https://openalex.org/C2780861071","wikidata":"https://www.wikidata.org/wiki/Q1062934","display_name":"Character (mathematics)","level":2,"score":0.7556983232498169},{"id":"https://openalex.org/C90805587","wikidata":"https://www.wikidata.org/wiki/Q10944557","display_name":"Word (group theory)","level":2,"score":0.7503126859664917},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.6973682641983032},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6568635702133179},{"id":"https://openalex.org/C2777462759","wikidata":"https://www.wikidata.org/wiki/Q18395344","display_name":"Word embedding","level":3,"score":0.6398061513900757},{"id":"https://openalex.org/C98501671","wikidata":"https://www.wikidata.org/wiki/Q1948408","display_name":"Text segmentation","level":3,"score":0.5842185616493225},{"id":"https://openalex.org/C2777601683","wikidata":"https://www.wikidata.org/wiki/Q6499736","display_name":"Vocabulary","level":2,"score":0.5205365419387817},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.5005266666412354},{"id":"https://openalex.org/C117884012","wikidata":"https://www.wikidata.org/wiki/Q94489","display_name":"n-gram","level":3,"score":0.4194127023220062},{"id":"https://openalex.org/C28490314","wikidata":"https://www.wikidata.org/wiki/Q189436","display_name":"Speech recognition","level":1,"score":0.3724570572376251},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.2852208912372589},{"id":"https://openalex.org/C89600930","wikidata":"https://www.wikidata.org/wiki/Q1423946","display_name":"Segmentation","level":2,"score":0.24022555351257324},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.1975458860397339},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.12824532389640808},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C2524010","wikidata":"https://www.wikidata.org/wiki/Q8087","display_name":"Geometry","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/w18-6120","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/w18-6120","pdf_url":"https://www.aclweb.org/anthology/W18-6120.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2018 EMNLP Workshop W-NUT: The 4th Workshop on Noisy User-generated Text","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/w18-6120","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/w18-6120","pdf_url":"https://www.aclweb.org/anthology/W18-6120.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 2018 EMNLP Workshop W-NUT: The 4th Workshop on Noisy User-generated Text","raw_type":"proceedings-article"},"sustainable_development_goals":[{"score":0.7900000214576721,"display_name":"Quality Education","id":"https://metadata.un.org/sdg/4"}],"awards":[{"id":"https://openalex.org/G719861074","display_name":"\u5927\u898f\u6a21\u30de\u30eb\u30c1\u30e2\u30fc\u30c0\u30eb\u30c7\u30fc\u30bf\u306e\u5206\u6563\u8868\u73fe","funder_award_id":"18J15053","funder_id":"https://openalex.org/F4320334764","funder_display_name":"Japan Society for the Promotion of Science"},{"id":"https://openalex.org/G908683270","display_name":"Multivariate analysis of multi-domain data considering the association between data vectors","funder_award_id":"16H02789","funder_id":"https://openalex.org/F4320334764","funder_display_name":"Japan Society for the Promotion of Science"}],"funders":[{"id":"https://openalex.org/F4320334764","display_name":"Japan Society for the Promotion of Science","ror":"https://ror.org/00hhkn466"}],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W2912630292.pdf","grobid_xml":"https://content.openalex.org/works/W2912630292.grobid-xml"},"referenced_works_count":14,"referenced_works":["https://openalex.org/W130046785","https://openalex.org/W2080133951","https://openalex.org/W2101609803","https://openalex.org/W2153579005","https://openalex.org/W2250539671","https://openalex.org/W2463895987","https://openalex.org/W2493916176","https://openalex.org/W2757566340","https://openalex.org/W2962732637","https://openalex.org/W2963324947","https://openalex.org/W2963801581","https://openalex.org/W2964072233","https://openalex.org/W2996160789","https://openalex.org/W4294170691"],"related_works":["https://openalex.org/W2911655849","https://openalex.org/W4286432911","https://openalex.org/W3134737443","https://openalex.org/W3043635985","https://openalex.org/W4238770060","https://openalex.org/W2110885608","https://openalex.org/W2233156216","https://openalex.org/W2251364186","https://openalex.org/W2381705608","https://openalex.org/W2899277986"],"abstract_inverted_index":{"We":[0,55],"propose":[1],"a":[2,41,88],"new":[3],"word":[4,32,65,91,100,104],"embedding":[5,19],"method":[6,24,74,95,147],"called":[7],"word-like":[8,20],"character":[9,21,38],"n-gram":[10,46],"embedding,":[11,33],"which":[12,34],"learns":[13],"distributed":[14],"representations":[15],"of":[16,28,63,156],"words":[17,82,126,151],"by":[18,59],"ngrams.":[22],"Our":[23,131],"is":[25,107,116],"an":[26,61],"extension":[27],"recently":[29],"proposed":[30,71,146],"segmentation-free":[31],"directly":[35],"embeds":[36],"frequent":[37],"ngrams":[39],"from":[40],"raw":[42],"corpus.":[43],"However,":[44],"its":[45],"vocabulary":[47],"tends":[48],"to":[49,68],"contain":[50],"too":[51],"many":[52,122],"nonword":[53],"n-grams.":[54],"solved":[56],"this":[57],"problem":[58],"introducing":[60],"idea":[62],"expected":[64],"frequency.":[66],"Compared":[67],"the":[69,81,111,114,145,154],"previously":[70],"methods,":[72],"our":[73,94],"can":[75,148],"embed":[76,149],"more":[77,150],"words,":[78],"along":[79],"with":[80,102],"that":[83,144],"are":[84],"not":[85,97],"included":[86],"in":[87,113,117],"given":[89],"basic":[90],"dictionary.":[92],"Since":[93],"does":[96],"rely":[98],"on":[99,134],"segmentation":[101],"rich":[103],"dictionaries,":[105],"it":[106],"especially":[108],"effective":[109],"when":[110],"text":[112],"corpus":[115],"unsegmented":[118],"language":[119],"and":[120,124,141,152],"contains":[121],"neologisms":[123],"informal":[125],"(e.g.,":[127],"Chinese":[128,138],"SNS":[129],"dataset).":[130],"experimental":[132],"results":[133],"Sina":[135],"Weibo":[136],"(a":[137],"microblog":[139],"service)":[140],"Twitter":[142],"show":[143],"improve":[153],"performance":[155],"downstream":[157],"tasks.":[158]},"counts_by_year":[{"year":2021,"cited_by_count":1},{"year":2020,"cited_by_count":4},{"year":2019,"cited_by_count":1},{"year":2018,"cited_by_count":1}],"updated_date":"2026-07-22T07:51:19.307946","created_date":"2025-10-10T00:00:00"}
