LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference. Moon, S., Kim, J., Kim, J., Hong, S., Cha, J., Kim, M., Lim, S., Choi, G., Seo, D., Kim, J., Lee, H., Park, H., Ko, R., Choi, S., Park, J., Lee, J., & Kim, J. CoRR, 2024.
Link
Paper bibtex @article{journals/corr/abs-2408-07326,
added-at = {2025-01-14T00:00:00.000+0100},
author = {Moon, Seungjae and Kim, Jung-Hoon and Kim, Junsoo and Hong, Seongmin and Cha, Junseo and Kim, Minsu and Lim, Sukbin and Choi, Gyubin and Seo, Dongjin and Kim, Jongho and Lee, Hunjong and Park, Hyunjun and Ko, Ryeowook and Choi, Soongyu and Park, Jongse and Lee, Jinwon and Kim, Joo-Young},
biburl = {https://www.bibsonomy.org/bibtex/2bff5d992e2d644fa6b828a5468c4677b/dblp},
ee = {https://doi.org/10.48550/arXiv.2408.07326},
interhash = {65f572bb06d32ffdba0e265d53a82c1f},
intrahash = {bff5d992e2d644fa6b828a5468c4677b},
journal = {CoRR},
keywords = {dblp},
timestamp = {2025-01-20T07:09:58.000+0100},
title = {LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference.},
url = {http://dblp.uni-trier.de/db/journals/corr/corr2408.html#abs-2408-07326},
volume = {abs/2408.07326},
year = 2024
}
Downloads: 0
{"_id":"9Kvne5XCW68Cpfcjj","bibbaseid":"moon-kim-kim-hong-cha-kim-lim-choi-etal-lpualatencyoptimizedandhighlyscalableprocessorforlargelanguagemodelinference-2024","author_short":["Moon, S.","Kim, J.","Kim, J.","Hong, S.","Cha, J.","Kim, M.","Lim, S.","Choi, G.","Seo, D.","Kim, J.","Lee, H.","Park, H.","Ko, R.","Choi, S.","Park, J.","Lee, J.","Kim, J."],"bibdata":{"bibtype":"article","type":"article","added-at":"2025-01-14T00:00:00.000+0100","author":[{"propositions":[],"lastnames":["Moon"],"firstnames":["Seungjae"],"suffixes":[]},{"propositions":[],"lastnames":["Kim"],"firstnames":["Jung-Hoon"],"suffixes":[]},{"propositions":[],"lastnames":["Kim"],"firstnames":["Junsoo"],"suffixes":[]},{"propositions":[],"lastnames":["Hong"],"firstnames":["Seongmin"],"suffixes":[]},{"propositions":[],"lastnames":["Cha"],"firstnames":["Junseo"],"suffixes":[]},{"propositions":[],"lastnames":["Kim"],"firstnames":["Minsu"],"suffixes":[]},{"propositions":[],"lastnames":["Lim"],"firstnames":["Sukbin"],"suffixes":[]},{"propositions":[],"lastnames":["Choi"],"firstnames":["Gyubin"],"suffixes":[]},{"propositions":[],"lastnames":["Seo"],"firstnames":["Dongjin"],"suffixes":[]},{"propositions":[],"lastnames":["Kim"],"firstnames":["Jongho"],"suffixes":[]},{"propositions":[],"lastnames":["Lee"],"firstnames":["Hunjong"],"suffixes":[]},{"propositions":[],"lastnames":["Park"],"firstnames":["Hyunjun"],"suffixes":[]},{"propositions":[],"lastnames":["Ko"],"firstnames":["Ryeowook"],"suffixes":[]},{"propositions":[],"lastnames":["Choi"],"firstnames":["Soongyu"],"suffixes":[]},{"propositions":[],"lastnames":["Park"],"firstnames":["Jongse"],"suffixes":[]},{"propositions":[],"lastnames":["Lee"],"firstnames":["Jinwon"],"suffixes":[]},{"propositions":[],"lastnames":["Kim"],"firstnames":["Joo-Young"],"suffixes":[]}],"biburl":"https://www.bibsonomy.org/bibtex/2bff5d992e2d644fa6b828a5468c4677b/dblp","ee":"https://doi.org/10.48550/arXiv.2408.07326","interhash":"65f572bb06d32ffdba0e265d53a82c1f","intrahash":"bff5d992e2d644fa6b828a5468c4677b","journal":"CoRR","keywords":"dblp","timestamp":"2025-01-20T07:09:58.000+0100","title":"LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference.","url":"http://dblp.uni-trier.de/db/journals/corr/corr2408.html#abs-2408-07326","volume":"abs/2408.07326","year":"2024","bibtex":"@article{journals/corr/abs-2408-07326,\n added-at = {2025-01-14T00:00:00.000+0100},\n author = {Moon, Seungjae and Kim, Jung-Hoon and Kim, Junsoo and Hong, Seongmin and Cha, Junseo and Kim, Minsu and Lim, Sukbin and Choi, Gyubin and Seo, Dongjin and Kim, Jongho and Lee, Hunjong and Park, Hyunjun and Ko, Ryeowook and Choi, Soongyu and Park, Jongse and Lee, Jinwon and Kim, Joo-Young},\n biburl = {https://www.bibsonomy.org/bibtex/2bff5d992e2d644fa6b828a5468c4677b/dblp},\n ee = {https://doi.org/10.48550/arXiv.2408.07326},\n interhash = {65f572bb06d32ffdba0e265d53a82c1f},\n intrahash = {bff5d992e2d644fa6b828a5468c4677b},\n journal = {CoRR},\n keywords = {dblp},\n timestamp = {2025-01-20T07:09:58.000+0100},\n title = {LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference.},\n url = {http://dblp.uni-trier.de/db/journals/corr/corr2408.html#abs-2408-07326},\n volume = {abs/2408.07326},\n year = 2024\n}\n\n","author_short":["Moon, S.","Kim, J.","Kim, J.","Hong, S.","Cha, J.","Kim, M.","Lim, S.","Choi, G.","Seo, D.","Kim, J.","Lee, H.","Park, H.","Ko, R.","Choi, S.","Park, J.","Lee, J.","Kim, J."],"key":"journals/corr/abs-2408-07326","id":"journals/corr/abs-2408-07326","bibbaseid":"moon-kim-kim-hong-cha-kim-lim-choi-etal-lpualatencyoptimizedandhighlyscalableprocessorforlargelanguagemodelinference-2024","role":"author","urls":{"Link":"https://doi.org/10.48550/arXiv.2408.07326","Paper":"http://dblp.uni-trier.de/db/journals/corr/corr2408.html#abs-2408-07326"},"keyword":["dblp"],"metadata":{"authorlinks":{}},"downloads":0,"html":""},"bibtype":"article","biburl":"http://www.bibsonomy.org/bib/author/Kim?items=1000","dataSources":["gK9RLP8dFNtZRgmvG"],"keywords":["dblp"],"search_terms":["lpu","latency","optimized","highly","scalable","processor","large","language","model","inference","moon","kim","kim","hong","cha","kim","lim","choi","seo","kim","lee","park","ko","choi","park","lee","kim"],"title":"LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference.","year":2024}