{
    "componentChunkName": "component---src-templates-post-tsx",
    "path": "/rlhf-vervosity/",
    "result": {"data":{"logo":null,"markdownRemark":{"html":"<h1>RLHF는 수다쟁이를 만든다?! (Does RLHF Breed Verbose Chatterboxes?!)</h1>\n<p>RLHF(<em>Reinforcement Learning from Human Feedback</em>)는 OpenAI의 ChatGPT를 만드는데 사용됐다고 알려지며 LLM(<em>Large-scaled Language Model</em>)의 새로운 연구분야로 자리잡은 기술입니다. RLHF는 이름에서 알 수 있듯이 사람의 피드백을 사용하여 AI 모델을 학습시키는 방법입니다. RLHF가 자리잡기 전까지는 Pre-training → SFT(<em>Supervised Fine-Tuning</em>)으로 이루어지는 파이프라인이 정석이였다면, 현재는 Pre-training → SFT → RLHF 파이프라인이 정석으로 자리잡게 되었습니다.\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/99ae9556-430d-4903-a2c1-fba58a14fec5\" width=\"550\"></p>\n<p>RLHF가 인기를 끌면서, RLAIF(<em>Reinforcement Learning from AI Feedback</em>), DPO(<em>Direct Preference Optimization</em>) 등의 RLHF 기반하여 나온 파생 학습법들이 등장하게 됐습니다. 저희를 포함한 국내﹒해외 LLM 기업들은 이런 RLHF 류의 학습법을 적용하면서 LLM의 성능을 끌어올리고 있습니다.</p>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/8a8b79a5-9b8b-4952-ac19-f2b7c7572276\" width=\"400\">\n<p>RLHF는 LLM이 생성한 답변에 대해서 사람의 피드백(좋다, 나쁘다)을 받아서 학습을 하기 때문에, 학습 이후 생성되는 답변을 보면 “오? 답변이 좋아졌는데?!” 싶게 바로 체감될 정도로 꽤나 큰 효과를 내고 있습니다. 하지만 RLHF의 문제점이 하나 있는데요, 바로 RLHF가 AI 모델을 투 머치 토커(too much talker)로 만든다는 것입니다!</p>\n<h2>RLHF와 답변 길이의 상관관계?</h2>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/b800288a-282c-4855-bd9b-5d4c34a07828\" width=\"350\">\n<p>RLHF(or DPO 등) 학습 전후를 비교해본 NLP 연구자분들은 가장 직접적으로 달라진 점을 느끼는 부분이 ‘응답 길이’일 것입니다. SFT만 한 모델과 RLHF까지 적용한 모델을 비교해보면 눈에 띄게 응답 길이가 길어진 것을 볼 수 있는데요, 아래는 <a href=\"https://arxiv.org/abs/2310.03716\">A Long Way to Go: Investigating Length Correlations in RLHF</a> 논문에서 같은 질문에 대해 응답 길이를 비교한 예시입니다.</p>\n<img width=\"400\" alt=\"image\" src=\"https://github.com/sooftware/sooftware.io/assets/42150335/014b0b84-a42b-46ed-92e7-e3c076f2e372\">\n<p>내용 자체는 비슷하지만, RLHF를 적용한 모델이 약 4배나 더 길게 생성한 것을 볼 수 있습니다.</p>\n<img width=\"700\" alt=\"image\" src=\"https://github.com/sooftware/sooftware.io/assets/42150335/c77d6eca-095f-4cd6-8223-f0434bbd2327\">\n<p>위 그래프에 보이는것처럼 RLHF 적용 전후를 비교했을 때, 응답 길이에 분명한 차이가 있는 것을 볼 수 있습니다.</p>\n<p>이 외의 연구들에서도 RLHF를 적용 했을 때 응답 길이가 길어진다는 연구 결과를 볼 수 있는데요, <a href=\"https://arxiv.org/abs/2308.02312\">Is Stack Overflow Obsolete? An Empirical Study of the Characteristics of ChatGPT Answers to Stack Overflow Questions</a>에서는 ChatGPT 응답 중 77%가 verbose 하다고 평가했으며, <a href=\"https://arxiv.org/abs/2312.11456\">Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint</a>에서는 DPO iterate마다 응답 길이가 2.5배씩 길어진다는 연구 결과도 리포트 됐습니다.</p>\n<h2>AI가 말을 길게 하면 좋은거 아닌가?</h2>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/8a3ce021-df65-42ea-ad2d-b29cfc7a1e9f\" width=\"400\">\n<p>LLM이 응답을 길게길게하면 좋은거 아닐까요? 실제로 RLHF 나오기 이전에는 LLM의 응답이 짧은게 큰 골칫거리였습니다. 😮‍💨 그리고 실제로 사람들은 AI가 길게 답변을 해주면 더 좋은 답변이라고 느끼는 경향이 있다고 합니다! 😲 그런데 이제 RLHF가 나오면서 말이 길어졌다고 하니, 좋은거 아닌가? 하는 분들도 있으실 것 같습니다.</p>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/8d1fd586-1f60-4cd6-b705-b49f9a40aff6\" width=\"400\">\n<p>하지만, 뭐든지 그때그때 “알맞게” 답변해주는 것이 가장 이상적입니다. ‘네’, ‘아니오’ 정도의 응답만 필요한데, ‘네 그것은 어쩌고저쩌고 …’ 와 같이 항상 길게 답변을 해준다면, 읽는 사람 입장에서 피로감을 유발하게 됩니다. 그런 관점에서, LLM의 응답이 전체적으로 길어지는 현상은 마냥 좋다고 볼 수는 없습니다. 또한, 현재 RLHF를 적용한 모델의 경향성을 보면, 응답 길이의 평균 자체가 상당히 높아져서 오히려 짧은 답변을 못한다고 봐야될 것 같습니다.</p>\n<h2>그렇다면 해결방법은?</h2>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/3a6679b2-b4ec-42bc-84be-13145402182f\" width=\"400\">\n<p>그렇다고 RLHF를 적용 안 할 수도 없는 노릇인데.. 어떻게 해야될까요?</p>\n<p>아직 명확한 답은 없지만, 최근 1-2개월 사이의 연구들에서 다양한 방식으로 이 문제를 해결하기 위한 방법들을 내놓고 있습니다. 다양한 방법들이 나오고 있는 만큼 조만간 이 문제에 대해서도 해결되지 않을까 기대해보고 있습니다! 관심 있으신 분들을 위해 관련 논문 2편 추천드리고 이번 포스팅은 여기에서 마무리하도록 하겠습니다! 😎</p>\n<ol>\n<li><a href=\"https://arxiv.org/abs/2402.18571\">Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards</a></li>\n</ol>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/7108c7d6-d435-4654-9457-81e63d51783f\" width=\"500\">\n<p>DPA(Directional Preference Alignment)라는 방법을 제시하며 multi-objective reward를 통해 LLM의 응답 길이 및 기타 문제들을 완화하는 방법을 제안</p>\n<ol start=\"2\">\n<li><a href=\"https://arxiv.org/abs/2402.07319\">ODIN: Disentangled Reward Mitigates Hacking in RLHF</a></li>\n</ol>\n<img src=\"https://github.com/sooftware/sooftware.io/assets/42150335/3b271b64-8b0f-463d-916d-48dea2d7f132\" width=\"500\">\n<p>ODIN이라는 방식을 제안. 기존 loss에서 length와 quality 관련된 수식을 추가함.</p>\n<h2>Reference</h2>\n<ul>\n<li><a href=\"https://arxiv.org/abs/2310.03716\">A Long Way to Go: Investigating Length Correlations in RLHF</a></li>\n<li><a href=\"https://arxiv.org/abs/2402.18571\">Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards</a></li>\n<li><a href=\"https://arxiv.org/abs/2308.02312\">Is Stack Overflow Obsolete? An Empirical Study of the Characteristics of ChatGPT Answers to Stack Overflow Questions</a></li>\n<li><a href=\"https://arxiv.org/abs/2312.11456\">Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint</a></li>\n<li><a href=\"https://arxiv.org/abs/2402.07319\">ODIN: Disentangled Reward Mitigates Hacking in RLHF</a></li>\n</ul>","htmlAst":{"type":"root","children":[{"type":"element","tagName":"h1","properties":{},"children":[{"type":"text","value":"RLHF는 수다쟁이를 만든다?! (Does RLHF Breed Verbose Chatterboxes?!)"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"RLHF("},{"type":"element","tagName":"em","properties":{},"children":[{"type":"text","value":"Reinforcement Learning from Human Feedback"}]},{"type":"text","value":")는 OpenAI의 ChatGPT를 만드는데 사용됐다고 알려지며 LLM("},{"type":"element","tagName":"em","properties":{},"children":[{"type":"text","value":"Large-scaled Language Model"}]},{"type":"text","value":")의 새로운 연구분야로 자리잡은 기술입니다. RLHF는 이름에서 알 수 있듯이 사람의 피드백을 사용하여 AI 모델을 학습시키는 방법입니다. RLHF가 자리잡기 전까지는 Pre-training → SFT("},{"type":"element","tagName":"em","properties":{},"children":[{"type":"text","value":"Supervised Fine-Tuning"}]},{"type":"text","value":")으로 이루어지는 파이프라인이 정석이였다면, 현재는 Pre-training → SFT → RLHF 파이프라인이 정석으로 자리잡게 되었습니다.\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/99ae9556-430d-4903-a2c1-fba58a14fec5","width":550},"children":[]}]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"RLHF가 인기를 끌면서, RLAIF("},{"type":"element","tagName":"em","properties":{},"children":[{"type":"text","value":"Reinforcement Learning from AI Feedback"}]},{"type":"text","value":"), DPO("},{"type":"element","tagName":"em","properties":{},"children":[{"type":"text","value":"Direct Preference Optimization"}]},{"type":"text","value":") 등의 RLHF 기반하여 나온 파생 학습법들이 등장하게 됐습니다. 저희를 포함한 국내﹒해외 LLM 기업들은 이런 RLHF 류의 학습법을 적용하면서 LLM의 성능을 끌어올리고 있습니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/8a8b79a5-9b8b-4952-ac19-f2b7c7572276","width":400},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"RLHF는 LLM이 생성한 답변에 대해서 사람의 피드백(좋다, 나쁘다)을 받아서 학습을 하기 때문에, 학습 이후 생성되는 답변을 보면 “오? 답변이 좋아졌는데?!” 싶게 바로 체감될 정도로 꽤나 큰 효과를 내고 있습니다. 하지만 RLHF의 문제점이 하나 있는데요, 바로 RLHF가 AI 모델을 투 머치 토커(too much talker)로 만든다는 것입니다!"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"h2","properties":{},"children":[{"type":"text","value":"RLHF와 답변 길이의 상관관계?"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/b800288a-282c-4855-bd9b-5d4c34a07828","width":350},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"RLHF(or DPO 등) 학습 전후를 비교해본 NLP 연구자분들은 가장 직접적으로 달라진 점을 느끼는 부분이 ‘응답 길이’일 것입니다. SFT만 한 모델과 RLHF까지 적용한 모델을 비교해보면 눈에 띄게 응답 길이가 길어진 것을 볼 수 있는데요, 아래는 "},{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2310.03716"},"children":[{"type":"text","value":"A Long Way to Go: Investigating Length Correlations in RLHF"}]},{"type":"text","value":" 논문에서 같은 질문에 대해 응답 길이를 비교한 예시입니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"width":400,"alt":"image","src":"https://github.com/sooftware/sooftware.io/assets/42150335/014b0b84-a42b-46ed-92e7-e3c076f2e372"},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"내용 자체는 비슷하지만, RLHF를 적용한 모델이 약 4배나 더 길게 생성한 것을 볼 수 있습니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"width":700,"alt":"image","src":"https://github.com/sooftware/sooftware.io/assets/42150335/c77d6eca-095f-4cd6-8223-f0434bbd2327"},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"위 그래프에 보이는것처럼 RLHF 적용 전후를 비교했을 때, 응답 길이에 분명한 차이가 있는 것을 볼 수 있습니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"이 외의 연구들에서도 RLHF를 적용 했을 때 응답 길이가 길어진다는 연구 결과를 볼 수 있는데요, "},{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2308.02312"},"children":[{"type":"text","value":"Is Stack Overflow Obsolete? An Empirical Study of the Characteristics of ChatGPT Answers to Stack Overflow Questions"}]},{"type":"text","value":"에서는 ChatGPT 응답 중 77%가 verbose 하다고 평가했으며, "},{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2312.11456"},"children":[{"type":"text","value":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint"}]},{"type":"text","value":"에서는 DPO iterate마다 응답 길이가 2.5배씩 길어진다는 연구 결과도 리포트 됐습니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"h2","properties":{},"children":[{"type":"text","value":"AI가 말을 길게 하면 좋은거 아닌가?"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/8a3ce021-df65-42ea-ad2d-b29cfc7a1e9f","width":400},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"LLM이 응답을 길게길게하면 좋은거 아닐까요? 실제로 RLHF 나오기 이전에는 LLM의 응답이 짧은게 큰 골칫거리였습니다. 😮‍💨 그리고 실제로 사람들은 AI가 길게 답변을 해주면 더 좋은 답변이라고 느끼는 경향이 있다고 합니다! 😲 그런데 이제 RLHF가 나오면서 말이 길어졌다고 하니, 좋은거 아닌가? 하는 분들도 있으실 것 같습니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/8d1fd586-1f60-4cd6-b705-b49f9a40aff6","width":400},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"하지만, 뭐든지 그때그때 “알맞게” 답변해주는 것이 가장 이상적입니다. ‘네’, ‘아니오’ 정도의 응답만 필요한데, ‘네 그것은 어쩌고저쩌고 …’ 와 같이 항상 길게 답변을 해준다면, 읽는 사람 입장에서 피로감을 유발하게 됩니다. 그런 관점에서, LLM의 응답이 전체적으로 길어지는 현상은 마냥 좋다고 볼 수는 없습니다. 또한, 현재 RLHF를 적용한 모델의 경향성을 보면, 응답 길이의 평균 자체가 상당히 높아져서 오히려 짧은 답변을 못한다고 봐야될 것 같습니다."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"h2","properties":{},"children":[{"type":"text","value":"그렇다면 해결방법은?"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/3a6679b2-b4ec-42bc-84be-13145402182f","width":400},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"그렇다고 RLHF를 적용 안 할 수도 없는 노릇인데.. 어떻게 해야될까요?"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"아직 명확한 답은 없지만, 최근 1-2개월 사이의 연구들에서 다양한 방식으로 이 문제를 해결하기 위한 방법들을 내놓고 있습니다. 다양한 방법들이 나오고 있는 만큼 조만간 이 문제에 대해서도 해결되지 않을까 기대해보고 있습니다! 관심 있으신 분들을 위해 관련 논문 2편 추천드리고 이번 포스팅은 여기에서 마무리하도록 하겠습니다! 😎"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"ol","properties":{},"children":[{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2402.18571"},"children":[{"type":"text","value":"Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards"}]}]},{"type":"text","value":"\n"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/7108c7d6-d435-4654-9457-81e63d51783f","width":500},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"DPA(Directional Preference Alignment)라는 방법을 제시하며 multi-objective reward를 통해 LLM의 응답 길이 및 기타 문제들을 완화하는 방법을 제안"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"ol","properties":{"start":2},"children":[{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2402.07319"},"children":[{"type":"text","value":"ODIN: Disentangled Reward Mitigates Hacking in RLHF"}]}]},{"type":"text","value":"\n"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"img","properties":{"src":"https://github.com/sooftware/sooftware.io/assets/42150335/3b271b64-8b0f-463d-916d-48dea2d7f132","width":500},"children":[]},{"type":"text","value":"\n"},{"type":"element","tagName":"p","properties":{},"children":[{"type":"text","value":"ODIN이라는 방식을 제안. 기존 loss에서 length와 quality 관련된 수식을 추가함."}]},{"type":"text","value":"\n"},{"type":"element","tagName":"h2","properties":{},"children":[{"type":"text","value":"Reference"}]},{"type":"text","value":"\n"},{"type":"element","tagName":"ul","properties":{},"children":[{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2310.03716"},"children":[{"type":"text","value":"A Long Way to Go: Investigating Length Correlations in RLHF"}]}]},{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2402.18571"},"children":[{"type":"text","value":"Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards"}]}]},{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2308.02312"},"children":[{"type":"text","value":"Is Stack Overflow Obsolete? An Empirical Study of the Characteristics of ChatGPT Answers to Stack Overflow Questions"}]}]},{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2312.11456"},"children":[{"type":"text","value":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint"}]}]},{"type":"text","value":"\n"},{"type":"element","tagName":"li","properties":{},"children":[{"type":"element","tagName":"a","properties":{"href":"https://arxiv.org/abs/2402.07319"},"children":[{"type":"text","value":"ODIN: Disentangled Reward Mitigates Hacking in RLHF"}]}]},{"type":"text","value":"\n"}]}],"data":{"quirksMode":false}},"excerpt":"RLHF는 수다쟁이를 만든다?! (Does RLHF Breed Verbose Chatterboxes?!) RLHF(Reinforcement Learning from Human Feedback)는 OpenAI의 ChatGPT…","fields":{"readingTime":{"text":"7 min read"}},"frontmatter":{"title":"RLHF는 수다쟁이를 만든다?! (Does RLHF Breed Verbose Chatterboxes?!)","userDate":"13 March 2024","date":"2024-03-13T01:11:55.000Z","tags":["nlp","rlhf"],"excerpt":null,"image":{"childImageSharp":{"gatsbyImageData":{"layout":"fullWidth","backgroundColor":"#f8f8e8","images":{"fallback":{"src":"/static/90ca8e1b50fff9d8ea8d16b2ebce3647/63169/rlhf-verbose.png","srcSet":"/static/90ca8e1b50fff9d8ea8d16b2ebce3647/38e6a/rlhf-verbose.png 750w,\n/static/90ca8e1b50fff9d8ea8d16b2ebce3647/828bd/rlhf-verbose.png 1080w,\n/static/90ca8e1b50fff9d8ea8d16b2ebce3647/e39e1/rlhf-verbose.png 1366w,\n/static/90ca8e1b50fff9d8ea8d16b2ebce3647/63169/rlhf-verbose.png 1648w","sizes":"100vw"},"sources":[{"srcSet":"/static/90ca8e1b50fff9d8ea8d16b2ebce3647/b9e89/rlhf-verbose.webp 750w,\n/static/90ca8e1b50fff9d8ea8d16b2ebce3647/77d9a/rlhf-verbose.webp 1080w,\n/static/90ca8e1b50fff9d8ea8d16b2ebce3647/d2c21/rlhf-verbose.webp 1366w,\n/static/90ca8e1b50fff9d8ea8d16b2ebce3647/8c422/rlhf-verbose.webp 1648w","type":"image/webp","sizes":"100vw"}]},"width":1,"height":1.0024271844660195}}},"author":[{"id":"Soohwan Kim","bio":"Co-founder/A.I. engineer at TUNiB.","avatar":{"children":[{"gatsbyImageData":{"layout":"fullWidth","backgroundColor":"#282838","images":{"fallback":{"src":"/static/a9e6b445142b247ee4cfa66155398bb2/0d6f4/soohwan.png","srcSet":"/static/a9e6b445142b247ee4cfa66155398bb2/248f9/soohwan.png 40w,\n/static/a9e6b445142b247ee4cfa66155398bb2/fd435/soohwan.png 80w,\n/static/a9e6b445142b247ee4cfa66155398bb2/0d6f4/soohwan.png 120w","sizes":"100vw"},"sources":[{"srcSet":"/static/a9e6b445142b247ee4cfa66155398bb2/e7f45/soohwan.webp 40w,\n/static/a9e6b445142b247ee4cfa66155398bb2/589ec/soohwan.webp 80w,\n/static/a9e6b445142b247ee4cfa66155398bb2/71a38/soohwan.webp 120w","type":"image/webp","sizes":"100vw"}]},"width":1,"height":0.6833333333333333}}]}}]}},"relatedPosts":{"totalCount":50,"edges":[{"node":{"id":"6529d72e-80e7-5d61-a672-d66276a3f641","excerpt":"MoE(Mixture of Experts) 기초부터 DeepSeek 혁신까지 작년 이맘때쯤 DeepSeek-V3가 저비용으로 엄청난 성능을 보이면서 화제가 되었습니다. 그 핵심 기술인 MoE(Mixture of Experts…","frontmatter":{"title":"MoE(Mixture of Experts) 기초부터 DeepSeek 혁신까지","date":"2026-01-15T01:11:55.000Z"},"fields":{"readingTime":{"text":"8 min read"},"slug":"/developed-moe/"}}},{"node":{"id":"8b49d3ef-4ce3-568c-9d71-240ff17fc3e0","excerpt":"BERT는 사실 Diffusion 모델이였다?! 최근 굉장히 흥미로운 글을 읽게되어 공유합니다. 원문 : link BERT와 Diffusion이 같은 방식이다?! NLP 연구자들에게 BERT는 너무 익숙한 모델입니다. 201…","frontmatter":{"title":"BERT는 사실 Diffusion 모델이였다?!","date":"2025-10-21T12:00:00.000Z"},"fields":{"readingTime":{"text":"8 min read"},"slug":"/bert_diffusion/"}}},{"node":{"id":"7c7e1676-ea84-58de-970c-ddec9aa10660","excerpt":"RLHF는 수다쟁이를 만든다?! (Does RLHF Breed Verbose Chatterboxes?!) RLHF(Reinforcement Learning from Human Feedback)는 OpenAI의 ChatGPT…","frontmatter":{"title":"RLHF는 수다쟁이를 만든다?! (Does RLHF Breed Verbose Chatterboxes?!)","date":"2024-03-13T01:11:55.000Z"},"fields":{"readingTime":{"text":"7 min read"},"slug":"/rlhf-vervosity/"}}},{"node":{"id":"2b9d3e22-1796-5fab-878d-5941d2e76e9d","excerpt":"LLM Paper Abstract - 2023.12 LLM…","frontmatter":{"title":"LLM Paper Abstract - 2023.12","date":"2024-01-05T10:00:00.000Z"},"fields":{"readingTime":{"text":"5 min read"},"slug":"/llm-abs-202312/"}}},{"node":{"id":"f43fa33b-917b-5c00-8462-937d99592ad7","excerpt":"What it MoE? (Mixture of Experts) 현존 최강 LLM인 GPT-4에서 “MoE (Mixture of Experts)” 방식을 채택하여 사용하고 있다고 알려졌는데요, 최근 AI계의 뜨거운 감자 Mistral AI…","frontmatter":{"title":"What is MoE? (Mixture of Experts)","date":"2023-12-22T01:11:55.000Z"},"fields":{"readingTime":{"text":"9 min read"},"slug":"/moe/"}}}]}},"pageContext":{"slug":"/rlhf-vervosity/","prev":{"excerpt":"규칙 없음 (No Rules Rules) ‘오징어게임’, ‘더 글로리’, ‘종이의 집’ 등으로 알려진 세계 최대 OTT(Over The Top) 플랫폼 ‘넷플릭스’는 이제는 국내에서도 누구나 알만한 서비스가 됐다. 2023년 1…","frontmatter":{"title":"규칙 없음 (No Rules Rules)","tags":["book","review"],"date":"2024-03-04T22:00:00.000Z","draft":false,"excerpt":null,"image":{"childImageSharp":{"gatsbyImageData":{"layout":"fullWidth","placeholder":{"fallback":"data:image/jpeg;base64,/9j/2wBDAAEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQH/2wBDAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQEBAQH/wgARCAANABQDASIAAhEBAxEB/8QAFwAAAwEAAAAAAAAAAAAAAAAAAAQGCf/EABUBAQEAAAAAAAAAAAAAAAAAAAQF/9oADAMBAAIQAxAAAAHAOyjXz2EAER//xAAZEAACAwEAAAAAAAAAAAAAAAADBAACBRD/2gAIAQEAAQUCmnl1RDwjLBqT/8QAHREAAgIDAAMAAAAAAAAAAAAAAwQCEgEFEQATFf/aAAgBAwEBPwFFnUi1u6XeRKxsGhJfHbHOkUDCZu1Isb49g2FczDiFZcJQnY05Lz//xAAdEQACAwACAwAAAAAAAAAAAAABAgMRIQAEEyJB/9oACAECAQE/AZUnabrtHIEiQyedCLMqstIFzCr+12Msfc5//8QAIhAAAgEDAgcAAAAAAAAAAAAAAgMBBCEiEBEAEjJBUVJx/9oACAEBAAY/AuKF4MJg1lOpt9sGSoCaFvUyt35JHe+oLa0zBfQJTvA4AvHxgsB+DGn/xAAdEAABAgcAAAAAAAAAAAAAAAABECEAEUFRcYGR/9oACAEBAAE/IYrPjvkHx7i3CVOF+dtdaVwp/9oADAMBAAIAAwAAABAAD//EABcRAQEBAQAAAAAAAAAAAAAAAAEhEBH/2gAIAQMBAT8QNghwV11ZBpY4/wD/xAAXEQEBAQEAAAAAAAAAAAAAAAABIREQ/9oACAECAQE/EID6sBU1lCohb4//xAAXEAEBAQEAAAAAAAAAAAAAAAABEQAQ/9oACAEBAAE/ENCyeJRykEoZCClw3aFSQVSCqQJkWnf/2Q=="},"images":{"fallback":{"src":"/static/8cf923bfbe8ee7e67a5edd8a2b0b4187/190cc/netflix.jpg","srcSet":"/static/8cf923bfbe8ee7e67a5edd8a2b0b4187/84519/netflix.jpg 750w,\n/static/8cf923bfbe8ee7e67a5edd8a2b0b4187/190cc/netflix.jpg 960w","sizes":"100vw"},"sources":[{"srcSet":"/static/8cf923bfbe8ee7e67a5edd8a2b0b4187/59596/netflix.webp 750w,\n/static/8cf923bfbe8ee7e67a5edd8a2b0b4187/f5c10/netflix.webp 960w","type":"image/webp","sizes":"100vw"}]},"width":1,"height":0.625}}},"author":[{"id":"Soohwan Kim","bio":"Co-founder/A.I. engineer at TUNiB.","avatar":{"childImageSharp":{"gatsbyImageData":{"layout":"fullWidth","placeholder":{"fallback":"data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAABQAAAAOCAYAAAAvxDzwAAAACXBIWXMAABYlAAAWJQFJUiTwAAADjElEQVQ4y23Oy48TdQDA8TExEaTttvSBfdHddru7bWc6bWd+8+i0u23n0SdlBRQXZGHDgiiLDwgqXjCIJEaC8cLBmHgwUU9EYzRqQuLJi/4NJB6NF+8evgbOHr7XT76SM5ix7s4QnRHnnm9yZzvBTIswN8JcP5bC67ZoWi7CdtFsn5bloZo+dSNAMYbIIqCmD6mJIVXdR3J6I7r9IQ3T59pZlW+uxzndCbPdC/HZXoq3TikowsfqBOjOmFZ7SrM9p2kfRbXn1O0jKNbsSbJ5BMnu9Gl3+qiiz4OPSvz0QRLHFGwOZH6+neLHT5YRbRerM0J0JrTas/8FZXNKzZgg2es+ZtvDdbs8+iHJl+9lWVP7OG2br26k+PvXJCfmFqoYIpwhTXtMwxpTN0coxhjFmCKbE2rGmKoYPQY9qi2fyzsq//4e5sNXi5TlLqbd5t6lPH/9kuDTG2usqgGi7dO0hzSsIXUzQDaGKGKMLEZUxZCKCJB02+PUpMH9vQwP7ybYnSxyfNrjwumA3dEiD94v8cfnK7xzWsbpujQtH9X0qBs+iuEjC5+a7lPVPSqai9SyelyYFbjkh5hqC3TkKOutLON2nkYpgtuMcT6IszdPslo8SLlcpmUH1A0XRQyQhUtNuFQ1l4o2QFI1h3OTVXbcg+grIfSVBRqlEGopgrYSRi0e4KiIse1mScSeopA/iLADmoZL3Rgg631q+oCq1qeq95FOzhQefpzn7eMpBmqcoBVj04pzwkky0eNMRYIdL8F3twusLe2nslrE6g5pGX1U8/FhD1nvUW1tUJK7SH9+n+DR1zF2vQSvH0lz88wiV45V2J1WuHqsxLXNAnuzNJdfWmK5/BylUgFhb6DZAxR9g7rpIos+Wttja2uE9M9vYb69k+DqfJErWzLOuoVqdKlpDo4jODms4zlFckuHObx4iHwuRi6fYqmYY201x/LqMrnFDNl8gRvvukhNdT9394rcOlNFMxrUhYFmW9imTEsp0mhWKC2nWSokyWSiFA7HSKcXiEb34fayyLVniUQk8rmn2drKIqlqiNcuVrh2ymQS1Nh8sc/GoMEbl7u8eb5D1yqTzkRJJsOkkiGymQVShyLE4yHWKnEq1RjpTIhmI8r2y3mkyloI38uha1n6bpVXrkw5+4LD/S/2uHnrIopaJhZ9hmQqwqHkAXJP8BDhyD46ZoWdMxOGcx/PNfECk/8AbxXdRjRliPoAAAAASUVORK5CYII="},"images":{"fallback":{"src":"/static/a9e6b445142b247ee4cfa66155398bb2/7cf1f/soohwan.png","srcSet":"/static/a9e6b445142b247ee4cfa66155398bb2/34f77/soohwan.png 750w,\n/static/a9e6b445142b247ee4cfa66155398bb2/a94f6/soohwan.png 1080w,\n/static/a9e6b445142b247ee4cfa66155398bb2/7cf1f/soohwan.png 1148w","sizes":"100vw"},"sources":[{"srcSet":"/static/a9e6b445142b247ee4cfa66155398bb2/38420/soohwan.webp 750w,\n/static/a9e6b445142b247ee4cfa66155398bb2/7470d/soohwan.webp 1080w,\n/static/a9e6b445142b247ee4cfa66155398bb2/b5ef6/soohwan.webp 1148w","type":"image/webp","sizes":"100vw"}]},"width":1,"height":0.6829268292682927}}}}]},"fields":{"readingTime":{"text":"20 min read"},"layout":"","slug":"/no-rules-rules/"}},"next":{"excerpt":"Terabyte(TB) 단위 데이터 셔플링 - terashuf 리눅스에서 TB 단위의 데이터를 line 기준으로 셔플링이 필요할 때가 (가끔) 있다. 직접 코딩해서 쓰기에는 메모리, 속도 등을 신경써야해서 생각보다 큰 작업인데, terashuf…","frontmatter":{"title":"Terabyte(TB) 단위 데이터 셔플링 - terashuf","tags":["toolkit","environment"],"date":"2024-03-20T10:00:00.000Z","draft":false,"excerpt":null,"image":{"childImageSharp":{"gatsbyImageData":{"layout":"fullWidth","placeholder":{"fallback":"data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAABQAAAAUCAYAAACNiR0NAAAACXBIWXMAABYlAAAWJQFJUiTwAAAFYElEQVQ4yx3U+VNchQHA8ddfnGnGUAnh2uMd+96+Yw922SsssAub5YblECRsrIC4EBoihIAJsQkxBtQREJqYTgxJdTpOYw5t0daYcRLjMU2lQ2sy6dRGqrWHpjP9pf2lP347088f8RGEBwsQJQVLk0h5RLyqnbxiO25F4sJMmtOjcSJukYRfY6RGZ67BzXhEYqHF5I2JSiosCU2WCChOhK3bEbZsK8VwufDqTsotiZAmU20q1ARkdle72Vvvpa9Sp7Nc4dL+Km48XcVcq58rh5p4b7aJqSYfAUNDFEW+81Ahgq1UwpRlfKqTHV4XSUOmJeKiJaSRiZj0RXUeqzDI7fRydbaBOz8bZfODF7j788O8MxTiZp/JiWqVKo+K4nQgiE6JiKoQ1iQ8ko1mr0hbSKE7qDIedzOfjfP2Uj/r7zzDHz47zxdfXeYfn59lZayJlTqNtUd9LIac5PwqiiQhlGsuQqqC5LAT1ewMRN00mQ5OjyW5szbB3zdP8Zev32Lj9uvc2zzP5u8WuLu2h5H6AMfrvbza6+NwUCXr1qkwNYSYJhNWZbyyg0dCCv0hlR8NlPOfj0f45sYI//r9FBvvzrB+cYRvb+zl1yd3c+1wBz07PAwnfFQaItWiTKvqI+VWEap0mYQuUq07GYiJ7ImJvD+W4NODNXx6NM2dhS6uHm/j3SMtbDzXw2ouw2JfCw0Bk/qgRYnDSUGhSMpVRsZ0IyRNmXa/TMYnciApM9cgs9AW46WOGKvZWlb763lpd4qzj6e5MNbODzvr2NuYptbvJaS7CRk6PkUnIXkY9KoIOy2JVq+TTJnIbFrifLeLZ5vLmawJMpkKc7w9wXxnNSvZWl7sayCXriUTr6ImGEaSVHZYJmFFo1lSmQk5Edp9Ermwg9GYneVmB2v9Mr8YCfBM0uCJmMmJTBVLPUlez9VxKJMgqPlQZIO0ZdEYNPBbJi2SyFK4lNWkHaHRp5KLiiy3aXx8wM+fX/Tzz1dr+PKtfZz7foiLuSSXJ5q4vdjLUFuMLTYF3efnSF8lp59MYbgNpuMyX+ccXKp3IHQHFBY7LBb6o5wYTXP52TY+erOff3/zEzbPdHN7uYONnw5w/8P99NTHGexM8+Opbg7vqmC2P068zM1gUOK/8ya/arMh7Aq4mKuX+e1+D03lKkVOH+tro1xZ6WXzlW42r+7hi1tHuP7GBC1SnH2pEE/3Rji6u5KlXCXxMp1H/Tr3X67iN4MywnBE5bWsxZ1pH2fG40i6SmdXI811Yf56bYg/3pzmb3+a5+i+h8nGa5kZrGMym+aV6RYGmoOYmkJSdnEmrfHLrIkQNxSOtAe4Ph7lk+kgWwqL2GYTuXSyj3s3J7h76zgbHx0gFfUz0VPJsZEURwdSPJaJklfiIK/EjlFYynsDJm92KAj5xQ6Ssp0LXR6OteoID+TT11nHt7fmWb95jPubi6w8105BqYilu7E7HDhdCt/LLyLkKCF/ezFFBcVMpjxMVesIXeUmy/0V3D3Xyw+yFQjfLUCxynjt1EHufX6W628fwO5S2F6ssCsZoD1u0h7zUGWIPOEtImFJDO4sI+lx43WICC/Uqny1lOSztRzhVBThwSKceVu5diLM+vVDzD3VylPDjZyabvj/jd0VJovjacosjfxCG5MPR3j+8QSmW0W0iQhJt4ODCRet5R6cooHbqTEWLOHGlMGt1S7uXcyycbKZL19OcPXJACsZg9lslEPZOHtq/XSUGViyhiypbC1yIDywrZSHbCoxT5DOUIThyjCneiKcG65huS/C6Q4PV4YizLf6mc8E2V9jMdMaZagxwiMxDw1+C69LZUuhDSGvkP8B0BAONJKL9ywAAAAASUVORK5CYII="},"images":{"fallback":{"src":"/static/ad029f5b0b89e949d609a8a7359c2901/4b516/terashuf.png","srcSet":"/static/ad029f5b0b89e949d609a8a7359c2901/76db5/terashuf.png 750w,\n/static/ad029f5b0b89e949d609a8a7359c2901/c9fe8/terashuf.png 1080w,\n/static/ad029f5b0b89e949d609a8a7359c2901/a637f/terashuf.png 1366w,\n/static/ad029f5b0b89e949d609a8a7359c2901/4b516/terashuf.png 1650w","sizes":"100vw"},"sources":[{"srcSet":"/static/ad029f5b0b89e949d609a8a7359c2901/9f825/terashuf.webp 750w,\n/static/ad029f5b0b89e949d609a8a7359c2901/44ca4/terashuf.webp 1080w,\n/static/ad029f5b0b89e949d609a8a7359c2901/1b075/terashuf.webp 1366w,\n/static/ad029f5b0b89e949d609a8a7359c2901/608b8/terashuf.webp 1650w","type":"image/webp","sizes":"100vw"}]},"width":1,"height":1.0048484848484849}}},"author":[{"id":"Soohwan Kim","bio":"Co-founder/A.I. engineer at TUNiB.","avatar":{"childImageSharp":{"gatsbyImageData":{"layout":"fullWidth","placeholder":{"fallback":"data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAABQAAAAOCAYAAAAvxDzwAAAACXBIWXMAABYlAAAWJQFJUiTwAAADjElEQVQ4y23Oy48TdQDA8TExEaTttvSBfdHddru7bWc6bWd+8+i0u23n0SdlBRQXZGHDgiiLDwgqXjCIJEaC8cLBmHgwUU9EYzRqQuLJi/4NJB6NF+8evgbOHr7XT76SM5ix7s4QnRHnnm9yZzvBTIswN8JcP5bC67ZoWi7CdtFsn5bloZo+dSNAMYbIIqCmD6mJIVXdR3J6I7r9IQ3T59pZlW+uxzndCbPdC/HZXoq3TikowsfqBOjOmFZ7SrM9p2kfRbXn1O0jKNbsSbJ5BMnu9Gl3+qiiz4OPSvz0QRLHFGwOZH6+neLHT5YRbRerM0J0JrTas/8FZXNKzZgg2es+ZtvDdbs8+iHJl+9lWVP7OG2br26k+PvXJCfmFqoYIpwhTXtMwxpTN0coxhjFmCKbE2rGmKoYPQY9qi2fyzsq//4e5sNXi5TlLqbd5t6lPH/9kuDTG2usqgGi7dO0hzSsIXUzQDaGKGKMLEZUxZCKCJB02+PUpMH9vQwP7ybYnSxyfNrjwumA3dEiD94v8cfnK7xzWsbpujQtH9X0qBs+iuEjC5+a7lPVPSqai9SyelyYFbjkh5hqC3TkKOutLON2nkYpgtuMcT6IszdPslo8SLlcpmUH1A0XRQyQhUtNuFQ1l4o2QFI1h3OTVXbcg+grIfSVBRqlEGopgrYSRi0e4KiIse1mScSeopA/iLADmoZL3Rgg631q+oCq1qeq95FOzhQefpzn7eMpBmqcoBVj04pzwkky0eNMRYIdL8F3twusLe2nslrE6g5pGX1U8/FhD1nvUW1tUJK7SH9+n+DR1zF2vQSvH0lz88wiV45V2J1WuHqsxLXNAnuzNJdfWmK5/BylUgFhb6DZAxR9g7rpIos+Wttja2uE9M9vYb69k+DqfJErWzLOuoVqdKlpDo4jODms4zlFckuHObx4iHwuRi6fYqmYY201x/LqMrnFDNl8gRvvukhNdT9394rcOlNFMxrUhYFmW9imTEsp0mhWKC2nWSokyWSiFA7HSKcXiEb34fayyLVniUQk8rmn2drKIqlqiNcuVrh2ymQS1Nh8sc/GoMEbl7u8eb5D1yqTzkRJJsOkkiGymQVShyLE4yHWKnEq1RjpTIhmI8r2y3mkyloI38uha1n6bpVXrkw5+4LD/S/2uHnrIopaJhZ9hmQqwqHkAXJP8BDhyD46ZoWdMxOGcx/PNfECk/8AbxXdRjRliPoAAAAASUVORK5CYII="},"images":{"fallback":{"src":"/static/a9e6b445142b247ee4cfa66155398bb2/7cf1f/soohwan.png","srcSet":"/static/a9e6b445142b247ee4cfa66155398bb2/34f77/soohwan.png 750w,\n/static/a9e6b445142b247ee4cfa66155398bb2/a94f6/soohwan.png 1080w,\n/static/a9e6b445142b247ee4cfa66155398bb2/7cf1f/soohwan.png 1148w","sizes":"100vw"},"sources":[{"srcSet":"/static/a9e6b445142b247ee4cfa66155398bb2/38420/soohwan.webp 750w,\n/static/a9e6b445142b247ee4cfa66155398bb2/7470d/soohwan.webp 1080w,\n/static/a9e6b445142b247ee4cfa66155398bb2/b5ef6/soohwan.webp 1148w","type":"image/webp","sizes":"100vw"}]},"width":1,"height":0.6829268292682927}}}}]},"fields":{"readingTime":{"text":"1 min read"},"layout":"","slug":"/terashuf/"}},"primaryTag":"nlp"}},
    "staticQueryHashes": ["3170763342","3229353822"]}