(ํ•œ๊ธ€๋ฒˆ์—ญ)Meta GEM: The Central Brain Accelerating Ads Recommendation AI Innovation

๋ฐ˜์‘ํ˜•
๐Ÿ’ก ์ด๊ธ€์€Engineering at Meta ์‚ฌ์ดํŠธ์— 2025๋…„ 11์›” 10์ผ์— ๊ฒŒ์žฌ๋œ Meta’s Generative Ads Model (GEM): The Central Brain Accelerating Ads Recommendation AI Innovation ์ฝ˜ํ…์ธ ๋ฅผ ํ•œ๊ธ€๋กœ ๋ฒˆ์—ญํ•œ ์ฝ˜ํ…์ธ  ์ž…๋‹ˆ๋‹ค.
Meta์˜ Generative Ads Recommendation Model (GEM)์€ ๊ด‘๊ณ  ์„ฑ๊ณผ์™€ ๊ด‘๊ณ ์ฃผ ROI๋ฅผ ํ–ฅ์ƒํ•˜๊ธฐ ์œ„ํ•ด ์„ค๊ณ„๋œ ๋Œ€๊ทœ๋ชจ Foundation Model์ž…๋‹ˆ๋‹ค. GEM์€ ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ์•„ํ‚คํ…์ฒ˜, ๊ณ ๋„ํ™”๋œ Post-training ๊ธฐ์ˆ , ๊ทธ๋ฆฌ๊ณ  ํšจ์œจ์ ์ธ ํ•™์Šต ์ธํ”„๋ผ๋ฅผ ํ™œ์šฉํ•˜์—ฌ ๋”์šฑ ๊ด€๋ จ์„ฑ ๋†’๊ณ  ๊ฐœ์ธํ™”๋œ ๊ด‘๊ณ  ๊ฒฝํ—˜์„ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค. ๋Ÿฐ์นญ ์ดํ›„, GEM์€ Instagram๊ณผ Facebook์—์„œ ๊ด‘๊ณ  Conversion์˜ ์œ ์˜๋ฏธํ•œ ์ฆ๊ฐ€๋ฅผ ๊ฒฌ์ธํ–ˆ์Šต๋‹ˆ๋‹ค.


์ €์ž: Huayu Li, Xiaoyi Liu, Jade Nie, Ellie Wen, Chunzhi Yang, Jiyan Yang, Nancy Yu, Habiya Beg, Gil Arditi, Neeraj Bhatia (2025๋…„ 11์›” 10์ผ)


์šฐ๋ฆฌ๋Š” ๋‹ค๋ฅธ ๊ด‘๊ณ  ์ถ”์ฒœ ๋ชจ๋ธ๋“ค์ด ๊ด€๋ จ์„ฑ ๋†’์€ ๊ด‘๊ณ ๋ฅผ ์ œ๊ณตํ•˜๋Š” ๋Šฅ๋ ฅ์„ ํ–ฅ์ƒ์‹œ์ผœ, ๊ด‘๊ณ  ์„ฑ๊ณผ์™€ ๊ด‘๊ณ ์ฃผ ROI๋ฅผ ๋†’์ด๋Š” ์ƒˆ๋กœ์šด Foundation Model์ธ Meta์˜ Generative Ads Recommendation Model (GEM)์— ๋Œ€ํ•œ ์„ธ๋ถ€ ์ •๋ณด๋ฅผ ๊ณต์œ ํ•ฉ๋‹ˆ๋‹ค.

  • GEM์˜ ์ƒˆ๋กœ์šด ์•„ํ‚คํ…์ฒ˜๋Š” ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜๊ฐ€ ์ฆ๊ฐ€ํ•จ์— ๋”ฐ๋ผ ํ™•์žฅ(Scale)์ด ๊ฐ€๋Šฅํ•˜๋ฉฐ, ์ผ๊ด€๋˜๊ฒŒ ๋” ์ •๋ฐ€ํ•œ ์˜ˆ์ธก์„ ํšจ์œจ์ ์œผ๋กœ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค.
  • GEM์€ ์ „์ฒด ๊ด‘๊ณ  ๋ชจ๋ธ(Ads Model Fleet)์— ๊ฑธ์ณ ์ผ๋ จ์˜ Post-training ๊ธฐ์ˆ ์„ ํ™œ์šฉํ•ด ํ•™์Šต ๋‚ด์šฉ์„ ์ „ํŒŒํ•˜๋ฉฐ, Meta์˜ ๊ด‘๊ณ  ์ถ”์ฒœ ์‹œ์Šคํ…œ(Ads Recommendation System)์˜ ํŒจ๋Ÿฌ๋‹ค์ž„ ์ „ํ™˜์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค.
  • GEM์€ ํ–ฅ์ƒ๋œ ํ•™์Šต ํ™•์žฅ์„ฑ(Scalability)์„ ํ™œ์šฉํ•˜์—ฌ LLM ์Šค์ผ€์ผ์˜ ๊ด‘๊ณ  Foundation Model์„ ๊ตฌ์ถ•ํ•˜๊ณ  ๋ฐ˜๋ณต(Iterating)ํ•˜๋Š” ๋ฐ ์ˆ˜์ฒœ ๊ฐœ์˜ GPU๋ฅผ ํšจ์œจ์ ์œผ๋กœ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค.
  • GEM์€ ์ด๋ฏธ Instagram๊ณผ Facebook ์ „๋ฐ˜์—์„œ ๊ด‘๊ณ  Conversion์˜ ์ƒ๋‹นํ•œ ์ฆ๊ฐ€๋ฅผ ์ด๋Œ์–ด๋‚ด๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

Meta๋Š” ์ œํ’ˆ๊ณผ ์„œ๋น„์Šค ์ „๋ฐ˜์— ๊ฑธ์ณ AI๋ฅผ ํ™œ์šฉํ•˜์—ฌ ๊ด‘๊ณ ์ฃผ๋ฅผ ์œ„ํ•œ ๋น„์ฆˆ๋‹ˆ์Šค ๊ฐ€์น˜๋ฅผ ์ฐฝ์ถœํ•˜๋Š” ๋ฐ ์•ž์žฅ์„œ ์™”์Šต๋‹ˆ๋‹ค. ์‚ฌ์šฉ์ž์—๊ฒŒ ๊ด‘๊ณ ๋ฅผ ๊ฐœ์ธํ™”ํ•˜๊ณ  ๊ฐ ๊ด‘๊ณ  ๋…ธ์ถœ(Impression)์˜ ์„ฑ๊ณผ๋ฅผ ๊ทน๋Œ€ํ™”ํ•˜๊ธฐ ์œ„ํ•ด ๊ณ ๊ธ‰ ๊ธฐ์ˆ ์„ ํ™œ์šฉํ•˜๋Š” ๊ฒƒ์€ ์šฐ๋ฆฌ๊ฐ€ ๊ด‘๊ณ  ์ถ”์ฒœ ์‹œ์Šคํ…œ์„ ๊ฐœ๋ฐœํ•˜๋Š” ๋ฐฉ์‹์˜ ํ•ต์‹ฌ์ž…๋‹ˆ๋‹ค.

Generative Ads Recommendation Model (GEM)์€ Meta์˜ ๊ฐ€์žฅ ์ง„๋ณด๋œ ๊ด‘๊ณ  Foundation Model๋กœ, LLM์—์„œ ์˜๊ฐ์„ ๋ฐ›์€ ํŒจ๋Ÿฌ๋‹ค์ž„์„ ๊ธฐ๋ฐ˜์œผ๋กœ ๊ตฌ์ถ•๋˜์—ˆ์œผ๋ฉฐ ์ˆ˜์ฒœ ๊ฐœ์˜ GPU์—์„œ ํ•™์Šต๋ฉ๋‹ˆ๋‹ค. ์ด๋Š” ์—…๊ณ„ ์ตœ๋Œ€ ๊ทœ๋ชจ์˜ ์ถ”์ฒœ ์‹œ์Šคํ…œ(RecSys) Foundation Model๋กœ, ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ(LLM)์˜ ์Šค์ผ€์ผ๋กœ ํ•™์Šต๋˜์—ˆ์Šต๋‹ˆ๋‹ค. GEM์€ ํšจ์œจ์ ์ธ Scaling Law๋ฅผ ์—ฌ๋Š” ์•„ํ‚คํ…์ฒ˜ ํ˜์‹ ์„ ๋„์ž…ํ•˜์—ฌ, ๋ฐ์ดํ„ฐ์™€ ์ปดํ“จํŒ… ์ž์›์— ๋น„๋ก€ํ•ด ๋น„์šฉ ํšจ์œจ์ ์œผ๋กœ ํ™•์žฅ๋˜๋Š” ์„ฑ๋Šฅ ์ด์ ์„ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค. ๋‹ค์ฐจ์› ๋ณ‘๋ ฌํ™”(Multi-dimensional Parallelism), ์ปค์Šคํ…€ GPU ์ปค๋„, ๋ฉ”๋ชจ๋ฆฌ ์ตœ์ ํ™”์™€ ๊ฐ™์€ ํ•™์Šต ๋ถ„์•ผ์˜ ๋ŒํŒŒ๊ตฌ๋“ค์ด GEM์„ ์ด ์ •๋„ ๊ทœ๋ชจ๋กœ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ–ˆ์Šต๋‹ˆ๋‹ค.
Post-training ๋‹จ๊ณ„์—์„œ GEM์€ ๊ณ ๊ธ‰ ์ง€์‹ ์ „์ด(Knowledge Transfer) ๊ธฐ์ˆ ์„ ์ ์šฉํ•˜์—ฌ ์ „์ฒด ๊ด‘๊ณ  ์Šคํƒ(Ads Stack)์˜ ๋‹ค์šด์ŠคํŠธ๋ฆผ ๋ชจ๋ธ(Downstream Models) ์„ฑ๋Šฅ์„ ์ฆํญ์‹œํ‚ต๋‹ˆ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด ์‚ฌ์šฉ์ž์˜ ์„ ํ˜ธ์— ๋งž์ถ˜ ๋”์šฑ ๊ด€๋ จ์„ฑ ๋†’๊ณ  ๊ฐœ์ธํ™”๋œ ๊ด‘๊ณ  ๊ฒฝํ—˜์„ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค. 2025๋…„ ์ดˆ GEM์„ ๋Ÿฐ์นญํ•œ ์ดํ›„, Facebook๊ณผ Instagram์— ์ ์šฉ๋œ GEM์€ 2๋ถ„๊ธฐ ๊ธฐ์ค€ Instagram์—์„œ 5%, Facebook Feed์—์„œ 3%์˜ ๊ด‘๊ณ  Conversion ์ฆ๊ฐ€๋ฅผ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค.

3๋ถ„๊ธฐ์—๋Š” GEM์˜ ๋ชจ๋ธ ์•„ํ‚คํ…์ฒ˜๋ฅผ ๊ฐœ์„ ํ•˜์—ฌ, ๋ฐ์ดํ„ฐ์™€ ์ปดํ“จํŒ… ์ž์›์„ ์ถ”๊ฐ€ํ•  ๋•Œ ์–ป์„ ์ˆ˜ ์žˆ๋Š” ์„ฑ๋Šฅ ์ด์ ์„ ๋‘ ๋ฐฐ๋กœ ๋Š˜๋ ธ์Šต๋‹ˆ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด ์šฐ๋ฆฌ๋Š” ๋งค๋ ฅ์ ์ธ ROI๋ฅผ ์œ ์ง€ํ•˜๋ฉฐ GEM์— ์‚ฌ์šฉํ•˜๋Š” ํ•™์Šต ์šฉ๋Ÿ‰์„ ์ง€์†์ ์œผ๋กœ ํ™•์žฅํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

GEM ์†Œ๊ฐœ (Introducing GEM)

GEM์€ ์„ธ ๊ฐ€์ง€ ํ•ต์‹ฌ ํ˜์‹ ์„ ํ†ตํ•ด RecSys์˜ ์ค‘๋Œ€ํ•œ ์ง„๋ณด๋ฅผ ๋‚˜ํƒ€๋ƒ…๋‹ˆ๋‹ค. 1) ๊ณ ๋„ํ™”๋œ ์•„ํ‚คํ…์ฒ˜๋ฅผ ํ†ตํ•œ ๋ชจ๋ธ ์Šค์ผ€์ผ๋ง, 2) ์ง€์‹ ์ „์ด๋ฅผ ์œ„ํ•œ Post-training ๊ธฐ์ˆ , 3) ํ™•์žฅ์„ฑ์„ ์ง€์›ํ•˜๋Š” ํ–ฅ์ƒ๋œ ํ•™์Šต ์ธํ”„๋ผ๊ฐ€ ๊ทธ๊ฒƒ์ž…๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ํ˜์‹ ๋“ค์€ ๊ด‘๊ณ  ์„ฑ๊ณผ๋ฅผ ํšจ์œจ์ ์œผ๋กœ ๋ถ€์ŠคํŒ…ํ•˜๊ณ , ๊ด‘๊ณ  ๋ชจ๋ธ ์ „๋ฐ˜์— ๊ฑธ์นœ ํšจ๊ณผ์ ์ธ ์ง€์‹ ๊ณต์œ ๋ฅผ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•˜๋ฉฐ, ํ•™์Šต์„ ์œ„ํ•œ ์ˆ˜์ฒœ ๊ฐœ์˜ GPU ์‚ฌ์šฉ์„ ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค. GEM์€ ๊ด‘๊ณ  RecSys์˜ ํŒจ๋Ÿฌ๋‹ค์ž„ ์ „ํ™˜์„ ์ฃผ๋„ํ•˜์—ฌ, ์‚ฌ์šฉ์ž ๋ชฉํ‘œ์™€ ๊ด‘๊ณ ์ฃผ ๋ชฉํ‘œ์˜ ๊ฒฐํ•ฉ ์ตœ์ ํ™”(Joint Optimization)๋ฅผ ํ†ตํ•ด ์ธ์ง€(Awareness), ์ฐธ์—ฌ(Engagement), ์ „ํ™˜(Conversion) ๋“ฑ ํผ๋„(Funnel) ์ „๋ฐ˜์˜ ๊ด‘๊ณ  ์„ฑ๊ณผ๋ฅผ ๋ณ€ํ™”์‹œ์ผฐ์Šต๋‹ˆ๋‹ค.

Meta์˜ ๊ด‘๊ณ  RecSys๋ฅผ ์œ„ํ•œ ๋Œ€๊ทœ๋ชจ Foundation Model์„ ๊ตฌ์ถ•ํ•˜๋ ค๋ฉด ๋‹ค์Œ๊ณผ ๊ฐ™์€ ์ฃผ์š” ๊ณผ์ œ๋“ค์„ ํ•ด๊ฒฐํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค:

  • Meta์˜ ๋ชจ๋“  ์•ฑ์— ๊ฑธ์นœ ๋ฐฉ๋Œ€ํ•˜๊ณ  ๋™์ ์ธ ๊ธฐ๋Šฅ ๊ณต๊ฐ„(Feature Space) ์ฒ˜๋ฆฌ: ๋งค์ผ ์šฐ๋ฆฌ ํ”Œ๋žซํผ ์ „๋ฐ˜์—์„œ ์ˆ˜์‹ญ์–ต ๊ฑด์˜ ์‚ฌ์šฉ์ž-๊ด‘๊ณ  ์ƒํ˜ธ์ž‘์šฉ์ด ๋ฐœ์ƒํ•˜์ง€๋งŒ, ํด๋ฆญ์ด๋‚˜ Conversion๊ณผ ๊ฐ™์€ ์˜๋ฏธ ์žˆ๋Š” ์‹ ํ˜ธ๋Š” ๋งค์šฐ ํฌ์†Œ(Sparse)ํ•ฉ๋‹ˆ๋‹ค. GEM์€ ์ด ๋ฐฉ๋Œ€ํ•˜์ง€๋งŒ ๋ถˆ๊ท ํ˜•ํ•œ ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ํ•™์Šตํ•˜์—ฌ ์˜๋ฏธ ์žˆ๋Š” ํŒจํ„ด์„ ์ธ์‹ํ•˜๊ณ  ๋‹ค์–‘ํ•œ ์‚ฌ์šฉ์ž์™€ ํ–‰๋™์— ๋Œ€ํ•ด ์ผ๋ฐ˜ํ™”(Generalize)ํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.
  • ๋‹ค์–‘ํ•œ ๋ฐ์ดํ„ฐ ๋ฐฐ์—ด ์ฒ˜๋ฆฌ: GEM์€ ๊ด‘๊ณ ์ฃผ ๋ชฉํ‘œ, ํฌ๋ฆฌ์—์ดํ‹ฐ๋ธŒ ํฌ๋งท, ์ธก์ • ์‹ ํ˜ธ(Measurement Signals), ๊ทธ๋ฆฌ๊ณ  ์—ฌ๋Ÿฌ ์ „๋‹ฌ ์ฑ„๋„์— ๊ฑธ์นœ ์‚ฌ์šฉ์ž ํ–‰๋™์„ ํฌํ•จํ•œ ๋‹ค์–‘ํ•œ ๊ด‘๊ณ  ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ํ•™์Šตํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ์ด์งˆ์„ฑ(Heterogeneity)์€ ๋ชจ๋ธ๋ง ๋ณต์žก์„ฑ์„ ํฌ๊ฒŒ ๊ฐ€์ค‘์‹œํ‚ค๋ฉฐ, GEM์ด ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ, ๋ฉ€ํ‹ฐ ์†Œ์Šค ์ž…๋ ฅ์„ ํ†ตํ•ฉํ•˜๊ณ  ๋ฏธ์„ธํ•œ ์ƒํ˜ธ์ž‘์šฉ์„ ํฌ์ฐฉํ•˜์—ฌ ๋‹ค๋ฅธ ๊ด‘๊ณ  ์ถ”์ฒœ ๋ชจ๋ธ๋“ค์„ ์ง€์›(Power)ํ•˜๋„๋ก ์š”๊ตฌํ•ฉ๋‹ˆ๋‹ค.
  • ํšจ์œจ์ ์ธ ํ•™์Šต: ๋Œ€๊ทœ๋ชจ Foundation Model์„ ํ•™์Šต์‹œํ‚ค๊ณ  ํ™•์žฅํ•˜๋Š” ๊ฒƒ์€ ์ˆ˜์ฒœ ๊ฐœ์˜ GPU๋ฅผ ํ•„์š”๋กœ ํ•˜๋ฉฐ, ํšจ์œจ์ ์ธ ํ•˜๋“œ์›จ์–ด ํ™œ์šฉ์„ ๋ณด์žฅํ•˜๊ธฐ ์œ„ํ•ด ๊ณ ๋„ํ™”๋œ ๋ณ‘๋ ฌํ™”(Parallelism)์™€ ์‹œ์Šคํ…œ ๋ ˆ๋ฒจ์˜ ์ตœ์ ํ™”๋ฅผ ํ™œ์šฉํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.

GEM์€ ๋‹ค์Œ๊ณผ ๊ฐ™์€ ๋ฐฉ๋ฒ•์œผ๋กœ ์ด๋Ÿฌํ•œ ๊ณผ์ œ๋“ค์„ ๊ทน๋ณตํ•ฉ๋‹ˆ๋‹ค:

  • ์ฃผ์–ด์ง„ ๋ฐ์ดํ„ฐ์™€ ์ปดํ“จํŒ… ์ž์› ์–‘์— ๋Œ€ํ•ด ๊ธฐ์กด ๊ด‘๊ณ  ์ถ”์ฒœ ๋žญํ‚น ๋ชจ๋ธ๋ณด๋‹ค ๊ด‘๊ณ  ์„ฑ๊ณผ ํ–ฅ์ƒ ํšจ์œจ์ด 4๋ฐฐ ๋” ๋†’์€ ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ๋ชจ๋ธ ์•„ํ‚คํ…์ฒ˜.
  • ํ‘œ์ค€ Knowledge Distillation ๋Œ€๋น„ 2๋ฐฐ์˜ ํšจ๊ณผ๋ฅผ ๋‹ฌ์„ฑํ•˜๋ฉฐ ์ง€์‹ ์ „์ด ํšจ๊ณผ๋ฅผ ๊ฐœ์„ ํ•˜๋Š” ์ƒˆ๋กœ์šด ํ”„๋ ˆ์ž„์›Œํฌ.
  • 16๋ฐฐ ๋” ๋งŽ์€ GPU๋ฅผ ์‚ฌ์šฉํ•˜๋ฉด์„œ ๋ชจ๋ธ FLOPS Utilization (MFU)์„ 1.43๋ฐฐ ์ฆ๊ฐ€์‹œํ‚ค๊ณ , ์œ ํšจ ํ•™์Šต FLOPS๋ฅผ 23๋ฐฐ ์ฆ๊ฐ€์‹œํ‚จ ์ƒˆ๋กœ์šด ํ•™์Šต ์Šคํƒ.

GEM ์•„ํ‚คํ…์ฒ˜ ๊ตฌ์ถ• ๋ฐ ํ™•์žฅ (Building and Scaling GEM’s Architecture)

GEM์€ ๊ด‘๊ณ  ๋ฐ ์œ ๊ธฐ์ (Organic) ์ƒํ˜ธ์ž‘์šฉ์—์„œ ์–ป์€ ๊ด‘๊ณ  ์ฝ˜ํ…์ธ ์™€ ์‚ฌ์šฉ์ž ์ฐธ์—ฌ(Engagement) ๋ฐ์ดํ„ฐ๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ํ•™์Šต๋ฉ๋‹ˆ๋‹ค. ์ด ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ์šฐ๋ฆฌ๋Š” ์‹œํ€€์Šค ๊ธฐ๋Šฅ(Sequence Features, ์˜ˆ: ํ™œ๋™ ๊ธฐ๋ก)๊ณผ ๋น„์‹œํ€€์Šค ๊ธฐ๋Šฅ(Non-sequence Features, ์˜ˆ: ์—ฐ๋ น, ์œ„์น˜, ๊ด‘๊ณ  ํฌ๋งท, ํฌ๋ฆฌ์—์ดํ‹ฐ๋ธŒ ํ‘œํ˜„ ๋“ฑ ์‚ฌ์šฉ์ž ๋ฐ ๊ด‘๊ณ  ์†์„ฑ)์˜ ๋‘ ๊ทธ๋ฃน์œผ๋กœ ๋ถ„๋ฅ˜๋˜๋Š” ํŠน์ง•(Features)์„ ๋„์ถœํ•ฉ๋‹ˆ๋‹ค. ๊ฐ ๊ทธ๋ฃน์—๋Š” ๋งž์ถคํ˜• ์–ดํ…์…˜ ๋ฉ”์ปค๋‹ˆ์ฆ˜(Attention Mechanisms)์ด ๋…๋ฆฝ์ ์œผ๋กœ ์ ์šฉ๋˜๋Š” ๋™์‹œ์—, ๊ต์ฐจ ๊ธฐ๋Šฅ ํ•™์Šต(Cross-feature Learning)๋„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ์ด ์„ค๊ณ„๋Š” ์ •ํ™•๋„๋ฅผ ๋†’์ด๊ณ  ๊ฐ ์–ดํ…์…˜ ๋ธ”๋ก์˜ ๊นŠ์ด์™€ ๋„ˆ๋น„๋ฅผ ๋ชจ๋‘ ํ™•์žฅํ•˜์—ฌ ์ด์ „ ์„ธ๋Œ€ ๋ชจ๋ธ ๋Œ€๋น„ 4๋ฐฐ์˜ ํšจ์œจ์„ฑ์„ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค.

Meta GEM’s Architecture

๋น„์‹œํ€€์Šค ๊ธฐ๋Šฅ ์ƒํ˜ธ์ž‘์šฉ ๋ชจ๋ธ๋ง (Non-Sequence Feature Interaction Modeling)

์‚ฌ์šฉ์ž ์†์„ฑ์ด ๊ด‘๊ณ  ํŠน์„ฑ๊ณผ ์–ด๋–ป๊ฒŒ ์ƒํ˜ธ์ž‘์šฉํ•˜๋Š”์ง€ ์ดํ•ดํ•˜๋Š” ๊ฒƒ์€ ์ •ํ™•ํ•œ ์ถ”์ฒœ์„ ์œ„ํ•ด ๋งค์šฐ ์ค‘์š”ํ•ฉ๋‹ˆ๋‹ค. GEM์€ Wukong ์•„ํ‚คํ…์ฒ˜๋ฅผ ๊ฐœ์„ ํ•˜์—ฌ ๊ต์ฐจ ๋ ˆ์ด์–ด ์–ดํ…์…˜ ์—ฐ๊ฒฐ(Cross-layer Attention Connections)์ด ์žˆ๋Š” ์Šคํƒํ˜• ์ธ์ˆ˜๋ถ„ํ•ด ๋จธ์‹ (Stackable Factorization Machines)์„ ์‚ฌ์šฉํ•จ์œผ๋กœ์จ, ๋ชจ๋ธ์ด ์–ด๋–ค ๊ธฐ๋Šฅ ์กฐํ•ฉ์ด ๊ฐ€์žฅ ์ค‘์š”ํ•œ์ง€ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ๊ฐ Wukong ๋ธ”๋ก์€ ์ˆ˜์ง์ (๋” ๊นŠ์€ ์ƒํ˜ธ์ž‘์šฉ) ๋ฐ ์ˆ˜ํ‰์ (๋” ๋„“์€ ๊ธฐ๋Šฅ ์ปค๋ฒ„๋ฆฌ์ง€)์œผ๋กœ ํ™•์žฅ ๊ฐ€๋Šฅํ•˜์—ฌ ์ ์  ๋” ๋ณต์žกํ•ด์ง€๋Š” ์‚ฌ์šฉ์ž-๊ด‘๊ณ  ํŒจํ„ด์„ ๋ฐœ๊ฒฌํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

์˜คํ”„๋ผ์ธ ์‹œํ€€์Šค ๊ธฐ๋Šฅ ๋ชจ๋ธ๋ง (Offline Sequence Feature Modeling)

๊ด‘๊ณ /์ฝ˜ํ…์ธ  ํด๋ฆญ, ์กฐํšŒ ๋ฐ ์ƒํ˜ธ์ž‘์šฉ์˜ ๊ธด ์‹œํ€€์Šค์— ๊ฑธ์นœ ์‚ฌ์šฉ์ž ํ–‰๋™ ์‹œํ€€์Šค(User Behavior Sequences)๋Š” ์„ ํ˜ธ๋„์™€ ์˜๋„(Intent)์— ๋Œ€ํ•œ ํ’๋ถ€ํ•œ ์‹ ํ˜ธ๋ฅผ ํฌํ•จํ•˜๊ณ  ์žˆ์ง€๋งŒ, ์ „ํ†ต์ ์ธ ์•„ํ‚คํ…์ฒ˜๋Š” ์ด๋Ÿฌํ•œ ๊ธด ์‹œํ€€์Šค๋ฅผ ํšจ์œจ์ ์œผ๋กœ ์ฒ˜๋ฆฌํ•˜๋Š” ๋ฐ ์–ด๋ ค์›€์„ ๊ฒช์Šต๋‹ˆ๋‹ค. GEM์€ ํ”ผ๋ผ๋ฏธ๋“œ ๋ณ‘๋ ฌ(Pyramid-parallel) ๊ตฌ์กฐ๋กœ ์ด ๋ฌธ์ œ๋ฅผ ๊ทน๋ณตํ•˜๋ฉฐ, ์—ฌ๋Ÿฌ ๋ณ‘๋ ฌ ์ƒํ˜ธ์ž‘์šฉ ๋ชจ๋“ˆ์„ ํ”ผ๋ผ๋ฏธ๋“œ ํ˜•ํƒœ๋กœ ์Œ“์•„ ๋ณต์žกํ•œ ์‚ฌ์šฉ์ž-๊ด‘๊ณ  ๊ด€๊ณ„๋ฅผ ๋Œ€๊ทœ๋ชจ๋กœ ํฌ์ฐฉํ•ฉ๋‹ˆ๋‹ค. ์ƒˆ๋กœ์šด ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ์˜คํ”„๋ผ์ธ ๊ธฐ๋Šฅ ์ธํ”„๋ผ๋Š” ์ตœ์†Œํ•œ์˜ ์Šคํ† ๋ฆฌ์ง€ ๋น„์šฉ์œผ๋กœ ์ตœ๋Œ€ ์ˆ˜์ฒœ ๊ฐœ์˜ ์ด๋ฒคํŠธ ์‹œํ€€์Šค๋ฅผ ์ฒ˜๋ฆฌํ•˜๋ฏ€๋กœ, GEM์€ ํ›จ์”ฌ ๋” ๊ธด ์‚ฌ์šฉ์ž ์œ ๊ธฐ์ /๊ด‘๊ณ  ์ƒํ˜ธ์ž‘์šฉ ๊ธฐ๋ก์œผ๋กœ๋ถ€ํ„ฐ ํ•™์Šตํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ํ™•์žฅ๋œ ์‚ฌ์šฉ์ž ํ–‰๋™ ์‹œํ€€์Šค๋ฅผ ๋ชจ๋ธ๋งํ•จ์œผ๋กœ์จ, GEM์€ ํŒจํ„ด๊ณผ ๊ด€๊ณ„๋ฅผ ๋” ํšจ๊ณผ์ ์œผ๋กœ ๋ฐœ๊ฒฌํ•˜์—ฌ ์‚ฌ์šฉ์ž์˜ ๊ตฌ๋งค ์—ฌ์ •(Purchase Journey)์— ๋Œ€ํ•ด ๋” ๊นŠ๊ณ  ์ •ํ™•ํ•˜๊ฒŒ ์ดํ•ดํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

๊ต์ฐจ ๊ธฐ๋Šฅ ํ•™์Šต (Cross-Feature Learning)

๊ธฐ์กด ์ ‘๊ทผ ๋ฐฉ์‹์€ ๋‹ค์šด์ŠคํŠธ๋ฆผ ์ž‘์—…์„ ์œ„ํ•ด ์‚ฌ์šฉ์ž ํ–‰๋™ ์‹œํ€€์Šค๋ฅผ ์••์ถ•๋œ ๋ฒกํ„ฐ๋กœ ๋ณ€ํ™˜ํ•˜๋Š”๋ฐ, ์ด๋Š” ์ค‘์š”ํ•œ ์ฐธ์—ฌ(Engagement) ์‹ ํ˜ธ๋ฅผ ์žƒ์„ ์œ„ํ—˜์ด ์žˆ์Šต๋‹ˆ๋‹ค. GEM์€ ์ „์ฒด ์‹œํ€€์Šค ์ •๋ณด๋ฅผ ๋ณด์กดํ•˜๋ฉด์„œ ํšจ์œจ์ ์ธ ๊ต์ฐจ ๊ธฐ๋Šฅ ํ•™์Šต์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•˜๋Š” ๋‹ค๋ฅธ ์ ‘๊ทผ ๋ฐฉ์‹์„ ์ทจํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ์˜ ์„ค๊ณ„์ธ InterFormer๋Š” ์‹œํ€€์Šค ํ•™์Šต(์˜ˆ: ์ปค์Šคํ…€ ํŠธ๋žœ์Šคํฌ๋จธ ์•„ํ‚คํ…์ฒ˜)๊ณผ ๊ต์ฐจ ๊ธฐ๋Šฅ ์ƒํ˜ธ์ž‘์šฉ ๋ ˆ์ด์–ด ์‚ฌ์ด๋ฅผ ๊ต์ฐจํ•˜๋Š” ๊ตฌ์กฐ(Interleaving Structure)๋ฅผ ๊ฐ€์ง„ ๋ณ‘๋ ฌ ์š”์•ฝ(Parallel Summarization)์„ ์ฑ„ํƒํ•ฉ๋‹ˆ๋‹ค. ์ด๋Š” ์ „์ฒด ์‚ฌ์šฉ์ž ์—ฌ์ •์— ๋Œ€ํ•œ ์ ‘๊ทผ์„ ์œ ์ง€ํ•˜๋ฉด์„œ ์‹œํ€€์Šค ์ดํ•ด๋ฅผ ์ ์ง„์ ์œผ๋กœ ์ •๊ตํ™”ํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ์ด ์„ค๊ณ„๋Š” ์‚ฌ์šฉ์ž ์‹œํ€€์Šค ๋ฐ์ดํ„ฐ์˜ ๊ตฌ์กฐ์  ๋ฌด๊ฒฐ์„ฑ์„ ๋ณด์กดํ•˜๋ฉด์„œ ํšจ์œจ์ ์ธ ์ƒํ˜ธ์ž‘์šฉ ํ•™์Šต์„ ์ด‰์ง„ํ•˜์—ฌ, GEM์ด ์ค‘์š”ํ•œ ํ–‰๋™ ์‹ ํ˜ธ๋ฅผ ์žƒ์ง€ ์•Š๊ณ  ๋” ๋†’์€ ๋ ˆ์ด์–ด ์ˆ˜๋กœ ํ™•์žฅํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค.

๋„๋ฉ”์ธ๋ณ„ ์ตœ์ ํ™”๋ฅผ ํ†ตํ•œ ๋ฉ€ํ‹ฐ ๋„๋ฉ”์ธ ํ•™์Šต (Multi-Domain Learning With Domain-Specific Optimization)

์ „ํ†ต์ ์ธ ๊ด‘๊ณ  ์ถ”์ฒœ ์‹œ์Šคํ…œ์€ ๊ด‘๋ฒ”์œ„ํ•œ ์ œํ’ˆ ์ƒํƒœ๊ณ„ ์ „๋ฐ˜์—์„œ ํ•™์Šต ๊ท ํ˜•์„ ๋งž์ถ”๋Š” ๋ฐ ์–ด๋ ค์›€์„ ๊ฒช์–ด์™”์Šต๋‹ˆ๋‹ค. ํ‘œ๋ฉด(Surfaces)์„ ๊ณ ๋ฆฝ๋œ ๊ฒƒ์œผ๋กœ ์ทจ๊ธ‰ํ•˜๊ฑฐ๋‚˜(๊ท€์ค‘ํ•œ ๊ต์ฐจ ํ”Œ๋žซํผ ์ธ์‚ฌ์ดํŠธ ๋ˆ„๋ฝ), ๋™์ผํ•˜๊ฒŒ ์ทจ๊ธ‰(ํ”Œ๋žซํผ๋ณ„ ํ–‰๋™ ๋ฌด์‹œ)ํ–ˆ๊ธฐ ๋•Œ๋ฌธ์ž…๋‹ˆ๋‹ค. Facebook, Instagram, Business Messaging๊ณผ ๊ฐ™์€ ์„œ๋กœ ๋‹ค๋ฅธ Meta์˜ ํ‘œ๋ฉด๋“ค์€ ๊ฐ๊ฐ ๊ณ ์œ ํ•œ ์‚ฌ์šฉ์ž ํ–‰๋™๊ณผ ์ƒํ˜ธ์ž‘์šฉ ํŒจํ„ด์„ ๊ฐ€์ง‘๋‹ˆ๋‹ค. GEM์€ ํ‘œ๋ฉด ๊ฐ„ ์‚ฌ์šฉ์ž ์ƒํ˜ธ์ž‘์šฉ(Cross-surface User Interactions)์œผ๋กœ๋ถ€ํ„ฐ ํ•™์Šตํ•˜๋Š” ๋™์‹œ์— ์˜ˆ์ธก์ด ๊ฐ ํ‘œ๋ฉด์˜ ๊ณ ์œ ํ•œ ํŠน์„ฑ์— ๋งž์ถฐ์ง€๋„๋ก ๋ณด์žฅํ•จ์œผ๋กœ์จ ์ด ๋ฌธ์ œ๋ฅผ ํ•ด๊ฒฐํ•ฉ๋‹ˆ๋‹ค. ์˜ˆ๋ฅผ ๋“ค์–ด, ์ด๋ฅผ ํ†ตํ•ด GEM์€ Instagram ๋น„๋””์˜ค ๊ด‘๊ณ  ์ฐธ์—ฌ์—์„œ ์–ป์€ ์ธ์‚ฌ์ดํŠธ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ Facebook Feed ๊ด‘๊ณ  ์˜ˆ์ธก์„ ๊ฐœ์„ ํ•˜๋Š” ๋™์‹œ์—, ๊ฐ ๋„๋ฉ”์ธ์˜ ์˜ˆ์ธก์„ ํŠน์ • ๋ชฉํ‘œ(ํด๋ฆญ ๋˜๋Š” Conversion ๋“ฑ)์— ๋งž๊ฒŒ ์ตœ์ ํ™”ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

Post-Training ๊ธฐ์ˆ ๋กœ ์ „์ด ํšจ์œจ์„ฑ ๊ทน๋Œ€ํ™” (Maximizing Transfer Efficiency With Post Training Techniques)

GEM์€ ๊ทธ ์ง€์‹์ด ์ˆ˜๋ฐฑ ๊ฐœ์˜ ์‚ฌ์šฉ์ž ๋Œ€๋ฉด Vertical Models (VMs)๋กœ ํšจ์œจ์ ์œผ๋กœ ์ „์ด๋  ๋•Œ ๋น„๋กœ์†Œ ์˜ํ–ฅ๋ ฅ์„ ๋ฐœํœ˜ํ•ฉ๋‹ˆ๋‹ค. GEM Foundation Model (FM)์˜ ์„ฑ๋Šฅ์„ ์‚ฌ์šฉ์ž ๋Œ€๋ฉด VM์˜ ์ธก์ • ๊ฐ€๋Šฅํ•œ ์ด์ต์œผ๋กœ ๋ณ€ํ™˜ํ•˜๊ธฐ ์œ„ํ•ด, ์šฐ๋ฆฌ๋Š” ์ง์ ‘(Direct) ๋ฐ ๊ณ„์ธต์ (Hierarchical) ์ง€์‹ ์ „์ด ์ „๋žต์„ ๋ชจ๋‘ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค.

์ง์ ‘ ์ „์ด๋Š” GEM์ด ํ•™์Šต๋œ ๋™์ผํ•œ ๋ฐ์ดํ„ฐ ๊ณต๊ฐ„ ๋‚ด์˜ ์ฃผ์š” VM์œผ๋กœ ์ง€์‹์„ ์ „์ดํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ๊ณ„์ธต์  ์ „์ด๋Š” GEM์˜ ์ง€์‹์„ ๋„๋ฉ”์ธ ํŠนํ™” FM์œผ๋กœ ์ฆ๋ฅ˜(Distill)ํ•˜๊ณ , ์ด๋“ค์ด ๋‹ค์‹œ VM์„ ๊ฐ€๋ฅด์ณ ๊ด‘๊ณ  ๋ชจ๋ธ ์ „๋ฐ˜์— ๊ฑธ์นœ ๊ด‘๋ฒ”์œ„ํ•œ ๊ฐœ์„ ์„ ์ด๋Œ์–ด๋ƒ…๋‹ˆ๋‹ค. ์ด ์ ‘๊ทผ ๋ฐฉ์‹๋“ค์€ Knowledge Distillation, Representation Learning, Parameter Sharing์„ ํฌํ•จํ•œ ์ผ๋ จ์˜ ๊ธฐ์ˆ ์„ ํ•จ๊ป˜ ์‚ฌ์šฉํ•˜์—ฌ ์ „์ฒด ๊ด‘๊ณ  ๋ชจ๋ธ ๊ณต๊ฐ„์—์„œ ์ „์ด ํšจ์œจ์„ฑ์„ ๊ทน๋Œ€ํ™”ํ•˜๋ฉฐ, ํ‘œ์ค€ Knowledge Distillation ๋Œ€๋น„ 2๋ฐฐ์˜ ํšจ๊ณผ๋ฅผ ๋‹ฌ์„ฑํ•ฉ๋‹ˆ๋‹ค.

Meta Maximizing Transfer Efficiency With Post Training Techniques

์ง€์‹ ์ฆ๋ฅ˜ (Knowledge Distillation)

Meta์˜ ๊ด‘๊ณ  ์‹œ์Šคํ…œ์—์„œ VM๋“ค์€ FM ํ•™์Šต ๋ฐ ํ‰๊ฐ€์˜ ์ง€์—ฐ, ๊ทธ๋ฆฌ๊ณ  GEM ๋˜๋Š” FM ์˜ˆ์ธก๊ณผ VM์˜ ํ‘œ๋ฉด๋ณ„ ๋ชฉํ‘œ ๊ฐ„์˜ ๋„๋ฉ”์ธ ๋ถˆ์ผ์น˜๋กœ ์ธํ•ด ์ข…์ข… ์˜ค๋ž˜๋œ ๊ฐ๋…(Stale Supervision) ๋ฌธ์ œ๋ฅผ ๊ฒช์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ VM(ํ•™์ƒ)๊ณผ GEM(๊ต์‚ฌ) ์‚ฌ์ด์˜ ์˜ค๋ž˜๋˜๊ฑฐ๋‚˜ ์ •๋ ฌ๋˜์ง€ ์•Š์€ ์‹ ํ˜ธ๋Š” ์‹œ๊ฐ„์ด ์ง€๋‚จ์— ๋”ฐ๋ผ ํ•™์ƒ ๋ชจ๋ธ์˜ ์ •ํ™•๋„์™€ ์ ์‘์„ฑ์„ ์ €ํ•˜์‹œํ‚ฌ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

์ด๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด ์šฐ๋ฆฌ๋Š” ํ•™์Šต ์ค‘์— Student Adapter๋ฅผ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. ์ด๋Š” ๊ฐ€์žฅ ์ตœ๊ทผ์˜ Ground-truth ๋ฐ์ดํ„ฐ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๊ต์‚ฌ์˜ ์ถœ๋ ฅ(Outputs)์„ ์ •์ œํ•˜๋Š” ๊ฒฝ๋Ÿ‰ ๊ตฌ์„ฑ ์š”์†Œ์ž…๋‹ˆ๋‹ค. ์ด๋Š” ๊ต์‚ฌ์˜ ์˜ˆ์ธก์„ ๊ด€์ฐฐ๋œ ๊ฒฐ๊ณผ์™€ ๋” ์ž˜ ์ผ์น˜์‹œํ‚ค๋Š” ๋ณ€ํ™˜(Transformation)์„ ํ•™์Šตํ•˜์—ฌ, ํ•™์ƒ ๋ชจ๋ธ์ด ํ•™์Šต ์ „๋ฐ˜์— ๊ฑธ์ณ ๋” ์ตœ์‹ ์˜ ๋„๋ฉ”์ธ ๊ด€๋ จ ๊ฐ๋…์„ ๋ฐ›๋„๋ก ๋ณด์žฅํ•ฉ๋‹ˆ๋‹ค.

ํ‘œํ˜„ ํ•™์Šต (Representation Learning)

Representation Learning์€ ๋ชจ๋ธ์ด ์›์‹œ ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ์˜๋ฏธ ์žˆ๊ณ  ์••์ถ•๋œ ํŠน์ง•(Features)์„ ์ž๋™์œผ๋กœ ๋„์ถœํ•˜์—ฌ ๊ด‘๊ณ  ํด๋ฆญ ์˜ˆ์ธก๊ณผ ๊ฐ™์€ ๋‹ค์šด์ŠคํŠธ๋ฆผ ์ž‘์—…์„ ๋” ํšจ๊ณผ์ ์œผ๋กœ ์ˆ˜ํ–‰ํ•˜๊ฒŒ ํ•˜๋Š” ๊ณผ์ •์ž…๋‹ˆ๋‹ค. Representation Learning์€ ์˜๋ฏธ์ ์œผ๋กœ ์ •๋ ฌ๋œ ํŠน์ง•์„ ์ƒ์„ฑํ•˜์—ฌ Knowledge Distillation์„ ๋ณด์™„ํ•˜๋ฉฐ, ๊ต์‚ฌ์—์„œ ํ•™์ƒ ๋ชจ๋ธ๋กœ์˜ ํšจ์œจ์ ์ธ ์ง€์‹ ์ „์ด๋ฅผ ์ง€์›ํ•ฉ๋‹ˆ๋‹ค. ์ด ์ ‘๊ทผ ๋ฐฉ์‹์„ ํ†ตํ•ด GEM์€ ์ถ”๋ก (Inference) ์˜ค๋ฒ„ํ—ค๋“œ๋ฅผ ์ถ”๊ฐ€ํ•˜์ง€ ์•Š๊ณ ๋„ FM์—์„œ VM์œผ๋กœ์˜ ์ „์ด ํšจ์œจ์„ฑ์„ ํšจ๊ณผ์ ์œผ๋กœ ๊ฐœ์„ ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

ํŒŒ๋ผ๋ฏธํ„ฐ ๊ณต์œ  (Parameter Sharing)

Parameter Sharing์€ ์—ฌ๋Ÿฌ ๋ชจ๋ธ์ด๋‚˜ ๊ตฌ์„ฑ ์š”์†Œ๊ฐ€ ๋™์ผํ•œ ํŒŒ๋ผ๋ฏธํ„ฐ ์„ธํŠธ๋ฅผ ์žฌ์‚ฌ์šฉํ•˜์—ฌ ์ค‘๋ณต์„ ์ค„์ด๊ณ  ํšจ์œจ์„ฑ์„ ๊ฐœ์„ ํ•˜๋ฉฐ ์ง€์‹ ์ „์ด๋ฅผ ์ด‰์ง„ํ•˜๋Š” ๊ธฐ์ˆ ์ž…๋‹ˆ๋‹ค.

์šฐ๋ฆฌ์˜ ๋งฅ๋ฝ์—์„œ Parameter Sharing์€ VM์ด FM์˜ ๊ตฌ์„ฑ ์š”์†Œ๋ฅผ ์„ ํƒ์ ์œผ๋กœ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•˜์—ฌ ํšจ์œจ์ ์ธ ์ง€์‹ ์žฌ์‚ฌ์šฉ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด ๋” ์ž‘๊ณ  ์ง€์—ฐ ์‹œ๊ฐ„(Latency)์— ๋ฏผ๊ฐํ•œ VM๋“ค์ด ์ „์ฒด ๊ณ„์‚ฐ ๋น„์šฉ์„ ๋ถ€๋‹ดํ•˜์ง€ ์•Š๊ณ ๋„ FM์˜ ํ’๋ถ€ํ•œ ํ‘œํ˜„(Representations)๊ณผ ์‚ฌ์ „ ํ•™์Šต๋œ ํŒจํ„ด์„ ํ™œ์šฉํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

GEM ํ•™์Šต ๋ฐฉ๋ฒ• (How GEM Was Trained)

GEM์€ ์ผ๋ฐ˜์ ์œผ๋กœ ์ตœ์‹  LLM์—์„œ๋‚˜ ๋ณผ ์ˆ˜ ์žˆ๋Š” ๊ทœ๋ชจ๋กœ ์šด์˜๋ฉ๋‹ˆ๋‹ค. GEM์„ ํ•™์Šต์‹œํ‚ค๊ธฐ ์œ„ํ•ด์„œ๋Š” ํ•™์Šต ๋ ˆ์‹œํ”ผ(Training Recipes)์˜ ์ „๋ฉด์ ์ธ ๊ฐœํŽธ์ด ํ•„์š”ํ–ˆ์Šต๋‹ˆ๋‹ค. ์žฌ์„ค๊ณ„๋œ ํ•™์Šต ์Šคํƒ์€ 16๋ฐฐ ๋” ๋งŽ์€ GPU๋ฅผ ์‚ฌ์šฉํ•˜๋ฉด์„œ ์œ ํšจ ํ•™์Šต FLOPs๋ฅผ 23๋ฐฐ ์ฆ๊ฐ€์‹œํ‚ค๊ณ  ํšจ์œจ์„ฑ ๋˜ํ•œ ๊ฐœ์„ ํ–ˆ์Šต๋‹ˆ๋‹ค. ํ•˜๋“œ์›จ์–ด ํšจ์œจ์„ฑ์˜ ์ฃผ์š” ์ง€ํ‘œ์ธ MFU๋Š” 1.43๋ฐฐ ์ฆ๊ฐ€ํ•˜์—ฌ GPU ์ž์›์˜ ๋” ๋‚˜์€ ํ™œ์šฉ์„ ๋ฐ˜์˜ํ–ˆ์Šต๋‹ˆ๋‹ค. ์ฒ˜๋ฆฌ๋Ÿ‰(Throughput)๊ณผ ํšจ์œจ์„ฑ์„ ๋™์‹œ์— ๋†’์ด๋Š” ์ด๋Ÿฌํ•œ ๋Šฅ๋ ฅ์€ ์ด ๊ทœ๋ชจ์˜ Foundation Model์„ ํ•™์Šต์‹œํ‚ค๋Š” ๋ฐ ์ค‘์š”ํ•ฉ๋‹ˆ๋‹ค.

๊ฑฐ๋Œ€ํ•œ ๋ชจ๋ธ ํฌ๊ธฐ์™€ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์›Œํฌ๋กœ๋“œ๋ฅผ ์ง€์›ํ•˜๊ธฐ ์œ„ํ•ด ์šฐ๋ฆฌ๋Š” ๋‹ค์ฐจ์› ๋ณ‘๋ ฌํ™”(Multi-dimensional Parallelism), ์ปค์Šคํ…€ GPU ์ปค๋„, ๋ชจ๋ธ-์‹œ์Šคํ…œ ๊ณต๋™ ์„ค๊ณ„(Model-system Co-design)์™€ ๊ฐ™์€ ์ „๋žต์„ ์ฑ„์šฉํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๊ธฐ์ˆ ๋“ค์€ ์ˆ˜์ฒœ ๊ฐœ์˜ GPU์— ์ ์šฉ๋˜์–ด ๊ฑฐ์˜ ์„ ํ˜•์ ์ธ(Near-linear) ํ™•์žฅ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•˜๋ฉฐ, ์ปดํ“จํŒ… ์ฒ˜๋ฆฌ๋Ÿ‰, ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰, ์ „๋ฐ˜์ ์ธ ํ•˜๋“œ์›จ์–ด ํšจ์œจ์„ฑ์„ ๊ฐœ์„ ํ•ฉ๋‹ˆ๋‹ค.

๋ถ„์‚ฐ ํ•™์Šต (Distributed Training)

GEM๊ณผ ๊ฐ™์€ ๋Œ€๊ทœ๋ชจ ๋ชจ๋ธ์„ ํ•™์Šต์‹œํ‚ค๋ ค๋ฉด ๊ณ ๋ฐ€๋„(Dense) ๋ฐ ํฌ์†Œ(Sparse) ๊ตฌ์„ฑ ์š”์†Œ ๋ชจ๋‘์— ๊ฑธ์ณ ์‹ ์ค‘ํ•˜๊ฒŒ ์กฐ์œจ๋œ ๋ณ‘๋ ฌํ™” ์ „๋žต์ด ํ•„์š”ํ•ฉ๋‹ˆ๋‹ค. ๋ชจ๋ธ์˜ Dense ๋ถ€๋ถ„์— ๋Œ€ํ•ด์„œ๋Š” HSDP(Hybrid Sharded Distributed Parallel)์™€ ๊ฐ™์€ ๊ธฐ์ˆ ์ด ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰์„ ์ตœ์ ํ™”ํ•˜๊ณ  ํ†ต์‹  ๋น„์šฉ์„ ์ค„์—ฌ, ์ˆ˜์ฒœ ๊ฐœ์˜ GPU์— ๊ฑธ์ณ Dense ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ํšจ์œจ์ ์œผ๋กœ ๋ถ„๋ฐฐํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ๋Œ€์กฐ์ ์œผ๋กœ, ์ฃผ๋กœ ์‚ฌ์šฉ์ž ๋ฐ ์•„์ดํ…œ ๊ธฐ๋Šฅ์„ ์œ„ํ•œ ๋Œ€๊ทœ๋ชจ ์ž„๋ฒ ๋”ฉ ํ…Œ์ด๋ธ”์ธ Sparse ๊ตฌ์„ฑ ์š”์†Œ๋Š” ๋ฐ์ดํ„ฐ ๋ณ‘๋ ฌํ™”(Data Parallelism)์™€ ๋ชจ๋ธ ๋ณ‘๋ ฌํ™”(Model Parallelism)๋ฅผ ์‚ฌ์šฉํ•˜๋Š” 2์ฐจ์› ์ ‘๊ทผ ๋ฐฉ์‹์„ ์ฑ„ํƒํ•˜์—ฌ ๋™๊ธฐํ™” ํšจ์œจ์„ฑ๊ณผ ๋ฉ”๋ชจ๋ฆฌ ์ง€์—ญ์„ฑ(Locality)์„ ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค.

GPU ์ฒ˜๋ฆฌ๋Ÿ‰์„ ์œ„ํ•œ ์‹œ์Šคํ…œ ์ˆ˜์ค€ ์ตœ์ ํ™” (System-Level Optimizations for GPU Throughput)

๋ณ‘๋ ฌํ™” ์™ธ์—๋„ GPU ์ปดํ“จํŒ… ์ฒ˜๋ฆฌ๋Ÿ‰์„ ํฌํ™” ์ƒํƒœ๋กœ ๋งŒ๋“ค๊ณ  ํ•™์Šต ๋ณ‘๋ชฉ ํ˜„์ƒ์„ ์ค„์ด๊ธฐ ์œ„ํ•ด ์ผ๋ จ์˜ ๊ธฐ์ˆ ์„ ๊ตฌํ˜„ํ–ˆ์Šต๋‹ˆ๋‹ค:

  • ๊ฐ€๋ณ€ ๊ธธ์ด(Jagged)์˜ ์‚ฌ์šฉ์ž ์‹œํ€€์Šค์™€ ์—ฐ์‚ฐ ์œตํ•ฉ(Computation Fusion)์„ ์œ„ํ•ด ์„ค๊ณ„๋œ ์‚ฌ๋‚ด ์ปค์Šคํ…€ GPU ์ปค๋„๋กœ, ์ตœ์‹  GPU ํ•˜๋“œ์›จ์–ด ๊ธฐ๋Šฅ๊ณผ ์ตœ์ ํ™” ๊ธฐ์ˆ ์„ ํ™œ์šฉํ•ฉ๋‹ˆ๋‹ค.
  • ๋ฉ”๋ชจ๋ฆฌ ์ ˆ์•ฝ์„ ์œ„ํ•œ Activation Checkpointing๊ณผ ์‹คํ–‰ ํšจ์œจ์„ฑ ํ–ฅ์ƒ์„ ์œ„ํ•œ Operator Fusion์„ ํฌํ•จํ•œ ์ฃผ์š” ์ตœ์ ํ™”๋ฅผ ์ž๋™ํ™”ํ•˜๋Š” PyTorch 2.0์˜ ๊ทธ๋ž˜ํ”„ ๋ ˆ๋ฒจ ์ปดํŒŒ์ผ.
  • ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰(Footprint)์„ ์ค„์ด๊ธฐ ์œ„ํ•œ ํ™œ์„ฑํ™”(Activations)์šฉ FP8 ์–‘์žํ™” ๋ฐ ํ†ตํ•ฉ ์ž„๋ฒ ๋”ฉ ํฌ๋งท๊ณผ ๊ฐ™์€ ๋ฉ”๋ชจ๋ฆฌ ์••์ถ• ๊ธฐ์ˆ .
  • ๋˜ํ•œ, NCCLX(NVIDIA NCCL์˜ Meta ํฌํฌ)๋ฅผ ํ†ตํ•ด SM(Streaming Multiprocessor) ์ž์›์„ ์‚ฌ์šฉํ•˜์ง€ ์•Š๊ณ  ์ž‘๋™ํ•˜๋Š” GPU ํ†ต์‹  ์ง‘ํ•ฉ์ฒด(Collectives)๋ฅผ ๊ฐœ๋ฐœํ•˜์—ฌ ํ†ต์‹ ๊ณผ ์—ฐ์‚ฐ ์›Œํฌ๋กœ๋“œ ๊ฐ„์˜ ๊ฒฝํ•ฉ์„ ์ œ๊ฑฐํ•˜๊ณ  ์˜ค๋ฒ„๋žฉ ๋ฐ GPU ํ™œ์šฉ๋„๋ฅผ ๊ฐœ์„ ํ–ˆ์Šต๋‹ˆ๋‹ค.

ํ•™์Šต ์˜ค๋ฒ„ํ—ค๋“œ ๋ฐ ์ž‘์—… ์‹œ์ž‘ ์‹œ๊ฐ„ ๋‹จ์ถ• (Reducing Training Overhead and Job Startup Time)

ํ•™์Šต ๋ฏผ์ฒฉ์„ฑ์„ ๋†’์ด๊ณ  GPU ์œ ํœด ์ƒํƒœ๋ฅผ ์ตœ์†Œํ™”ํ•˜๊ธฐ ์œ„ํ•ด, ์šฐ๋ฆฌ๋Š” ์ƒˆ๋กœ์šด ๋ฐ์ดํ„ฐ๋ฅผ ์ฒ˜๋ฆฌํ•˜๋Š” ๋ฐ ์†Œ๋น„๋˜๋Š” ํ•™์Šต ์‹œ๊ฐ„์˜ ๋น„์œจ์ธ ์œ ํšจ ํ•™์Šต ์‹œ๊ฐ„(ETT)์„ ์ตœ์ ํ™”ํ–ˆ์Šต๋‹ˆ๋‹ค. Trainer ์ดˆ๊ธฐํ™”, ๋ฐ์ดํ„ฐ ๋ฆฌ๋” ์„ค์ •, Checkpointing, PyTorch 2.0 ์ปดํŒŒ์ผ ์‹œ๊ฐ„ ๋“ฑ์„ ์ตœ์ ํ™”ํ•˜์—ฌ ์ž‘์—… ์‹œ์ž‘ ์‹œ๊ฐ„์„ 5๋ฐฐ ๋‹จ์ถ•ํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์บ์‹ฑ ์ „๋žต์„ ํ†ตํ•ด PyTorch 2.0 ์ปดํŒŒ์ผ ์‹œ๊ฐ„์„ 7๋ฐฐ ์ค„์˜€์Šต๋‹ˆ๋‹ค.

๊ฐœ๋ฐœ ์ƒ์• ์ฃผ๊ธฐ ์ „๋ฐ˜์— ๊ฑธ์นœ GPU ํšจ์œจ์„ฑ ๊ทน๋Œ€ํ™” (Maximizing GPU Efficiency Across the Development Lifecycle)

GPU ํšจ์œจ์„ฑ์€ ์ดˆ๊ธฐ ์‹คํ—˜๋ถ€ํ„ฐ ๋Œ€๊ทœ๋ชจ ํ•™์Šต ๋ฐ Post-training์— ์ด๋ฅด๋Š” ๋ชจ๋ธ ์ƒ์• ์ฃผ๊ธฐ์˜ ๋ชจ๋“  ๋‹จ๊ณ„์—์„œ ์ตœ์ ํ™”๋ฉ๋‹ˆ๋‹ค. ํƒ์ƒ‰ ๋‹จ๊ณ„์—์„œ๋Š” ํ’€ ์‚ฌ์ด์ฆˆ ๋ชจ๋ธ์— ๋น„ํ•ด ํ›จ์”ฌ ๋‚ฎ์€ ๋น„์šฉ์œผ๋กœ ๊ฒฝ๋Ÿ‰ ๋ชจ๋ธ ๋ณ€ํ˜•(Variants)์„ ์‚ฌ์šฉํ•˜์—ฌ ๋ฐ˜๋ณต(Iteration)์„ ๊ฐ€์†ํ™”ํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๋ณ€ํ˜•๋“ค์€ ์ „์ฒด ์‹คํ—˜์˜ ์ ˆ๋ฐ˜ ์ด์ƒ์„ ์ง€์›ํ•˜๋ฉฐ, ์ตœ์†Œํ•œ์˜ ์ž์› ์˜ค๋ฒ„ํ—ค๋“œ๋กœ ๋น ๋ฅธ ์•„์ด๋””์–ด ๊ฒ€์ฆ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. Post-training ๋‹จ๊ณ„์—์„œ ๋ชจ๋ธ์€ Forward Pass๋ฅผ ์‹คํ–‰ํ•˜์—ฌ ๋‹ค์šด์ŠคํŠธ๋ฆผ ๋ชจ๋ธ์„ ์œ„ํ•œ ๋ ˆ์ด๋ธ” ๋ฐ ์ž„๋ฒ ๋”ฉ๊ณผ ๊ฐ™์€ ์ง€์‹์„ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค. ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ๊ณผ ๋‹ฌ๋ฆฌ, ์šฐ๋ฆฌ๋Š” FM์„ ๊ฐฑ์‹ (Refresh)ํ•˜๊ธฐ ์œ„ํ•ด ์ง€์†์ ์ธ ์˜จ๋ผ์ธ ํ•™์Šต๋„ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ํ•™์Šต๊ณผ Post-training ์ง€์‹ ์ƒ์„ฑ ๊ฐ„, ๊ทธ๋ฆฌ๊ณ  Foundation Model๊ณผ ๋‹ค์šด์ŠคํŠธ๋ฆผ ๋ชจ๋ธ ๊ฐ„์˜ ํŠธ๋ž˜ํ”ฝ ๊ณต์œ ๋ฅผ ๊ฐ•ํ™”ํ•˜์—ฌ ๊ณ„์‚ฐ ์ˆ˜์š”๋ฅผ ์ค„์ž…๋‹ˆ๋‹ค. ๋˜ํ•œ, ์—”๋“œํˆฌ์—”๋“œ ์‹œ์Šคํ…œ ์ฒ˜๋ฆฌ๋Ÿ‰์„ ๊ฐœ์„ ํ•˜๊ธฐ ์œ„ํ•ด ๋ชจ๋“  ๋‹จ๊ณ„์— GPU ํšจ์œจ์„ฑ ์ตœ์ ํ™”๊ฐ€ ์ ์šฉ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

๊ด‘๊ณ  ์ถ”์ฒœ์„ ์œ„ํ•œ Foundation Model์˜ ๋ฏธ๋ž˜ (The Future of Foundation Models for Ads Recommendations)

๊ด‘๊ณ  ์ถ”์ฒœ ์‹œ์Šคํ…œ์˜ ๋ฏธ๋ž˜๋Š” ์‚ฌ๋žŒ๋“ค์˜ ์„ ํ˜ธ์™€ ์˜๋„์— ๋Œ€ํ•œ ๋” ๊นŠ์€ ์ดํ•ด๋กœ ์ •์˜๋  ๊ฒƒ์ด๋ฉฐ, ๋ชจ๋“  ์ƒํ˜ธ์ž‘์šฉ์„ ๊ฐœ์ธ์ ์ธ ๊ฒƒ์ฒ˜๋Ÿผ ๋А๋ผ๊ฒŒ ํ•  ๊ฒƒ์ž…๋‹ˆ๋‹ค. ๊ด‘๊ณ ์ฃผ์—๊ฒŒ ์žˆ์–ด ์ด๋Š” ๋Œ€๊ทœ๋ชจ์˜ ์ผ๋Œ€์ผ ์—ฐ๊ฒฐ๋กœ ์ด์–ด์ ธ ๋” ๊ฐ•๋ ฅํ•œ ์ฐธ์—ฌ(Engagement)์™€ ์„ฑ๊ณผ(Outcomes)๋ฅผ ๊ฒฌ์ธํ•ฉ๋‹ˆ๋‹ค.

์•ž์œผ๋กœ GEM์€ ํ…์ŠคํŠธ, ์ด๋ฏธ์ง€, ์˜ค๋””์˜ค, ๋น„๋””์˜ค์™€ ๊ฐ™์€ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ ์ „๋ฐ˜์— ๊ฑธ์นœ ์œ ๊ธฐ์  ๋ฐ ๊ด‘๊ณ  ์ฝ˜ํ…์ธ ์—์„œ์˜ ์‚ฌ์šฉ์ž ์ƒํ˜ธ์ž‘์šฉ์„ ํฌํ•จํ•˜์—ฌ Meta์˜ ์ „์ฒด ์ƒํƒœ๊ณ„๋กœ๋ถ€ํ„ฐ ํ•™์Šตํ•  ๊ฒƒ์ž…๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ GEM์˜ ํ•™์Šต ๋‚ด์šฉ์€ Facebook๊ณผ Instagram์˜ ๋ชจ๋“  ์ฃผ์š” ํ‘œ๋ฉด์„ ์ปค๋ฒ„ํ•˜๋„๋ก ํ™•์žฅ๋  ๊ฒƒ์ž…๋‹ˆ๋‹ค. ๋” ๊ฐ•๋ ฅํ•ด์ง„ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ๊ธฐ๋ฐ˜์€ GEM์ด ํด๋ฆญ, Conversion, ์žฅ๊ธฐ์  ๊ฐ€์น˜(LTV) ์ด๋ฉด์˜ ๋ฏธ๋ฌ˜ํ•œ ์ฐจ์ด๋ฅผ ํฌ์ฐฉํ•˜๋„๋ก ๋„์šธ ๊ฒƒ์ด๋ฉฐ, ์œ ๊ธฐ์  ์ฝ˜ํ…์ธ ์™€ ๊ด‘๊ณ ๋ฅผ ๋ชจ๋‘ ์ง€๋Šฅ์ ์œผ๋กœ ๋žญํ‚น ๋งค๊ธธ ์ˆ˜ ์žˆ๋Š” ํ†ตํ•ฉ ์ฐธ์—ฌ ๋ชจ๋ธ(Unified Engagement Model)์„ ์œ„ํ•œ ๊ธธ์„ ์—ด์–ด ์‚ฌ๋žŒ๋“ค๊ณผ ๊ด‘๊ณ ์ฃผ์—๊ฒŒ ์ตœ๋Œ€์˜ ๊ฐ€์น˜๋ฅผ ์ œ๊ณตํ•  ๊ฒƒ์ž…๋‹ˆ๋‹ค.
์šฐ๋ฆฌ๋Š” ์•„ํ‚คํ…์ฒ˜๋ฅผ ๋ฐœ์ „์‹œํ‚ค๊ณ  ์ตœ์‹  AI ํ•˜๋“œ์›จ์–ด์—์„œ ํ•™์Šต ๋ ˆ์‹œํ”ผ๋ฅผ ์ง„๋ณด์‹œํ‚ด์œผ๋กœ์จ GEM์„ ์ง€์†์ ์œผ๋กœ ํ™•์žฅํ•˜๊ณ  ๋” ํฐ ํด๋Ÿฌ์Šคํ„ฐ์—์„œ ํ•™์Šต์‹œํ‚ฌ ๊ฒƒ์ด๋ฉฐ, ์ด๋ฅผ ํ†ตํ•ด ๋‹ค์–‘ํ•œ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๋ฅผ ๊ฐ€์ง„ ๋” ๋งŽ์€ ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ํšจ์œจ์ ์œผ๋กœ ํ•™์Šตํ•˜์—ฌ ์ •๋ฐ€ํ•œ ์˜ˆ์ธก์„ ์ œ๊ณตํ•  ๊ฒƒ์ž…๋‹ˆ๋‹ค. ๋˜ํ•œ ์šฐ๋ฆฌ๋Š” GEM์„ ์ง„ํ™”์‹œ์ผœ Inference-time Scaling์œผ๋กœ ์ถ”๋ก ํ•˜๊ณ  ์ปดํ“จํŒ… ํ• ๋‹น์„ ์ตœ์ ํ™”ํ•˜๋ฉฐ, ์˜๋„ ์ค‘์‹ฌ(Intent-centric)์˜ ์‚ฌ์šฉ์ž ์—ฌ์ •์„ ์ง€์›ํ•˜๊ณ , ๋” ๋†’์€ ROAS๋ฅผ ๊ฒฌ์ธํ•˜๋Š” ์—์ด์ „ํŠธํ˜•(Agentic), ์ธ์‚ฌ์ดํŠธ ์ฃผ๋„ํ˜• ๊ด‘๊ณ ์ฃผ ์ž๋™ํ™”๋ฅผ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•  ๊ฒƒ์ž…๋‹ˆ๋‹ค.

 

์›๋ฌธ : Meta’s Generative Ads Model (GEM): The Central Brain Accelerating Ads Recommendation AI Innovation

 

Meta’s Generative Ads Model (GEM): The Central Brain Accelerating Ads Recommendation AI Innovation

We’re sharing details about Meta’s Generative Ads Recommendation Model (GEM), a new foundation model that delivers increased ad performance and advertiser ROI by enhancing other ads recommendation …

engineering.fb.com

 

์ด๊ธ€์„ ๊ธฐ๋ฐ˜์œผ๋กœ ๋””์ง€ํ„ธ๋งˆ์ผ€ํ„ฐ๊ฐ€ Meta GEM์ตœ์ ํ™”๋ฅผ ์œ„ํ•ด ๊ณ ๋ คํ•ด์•ผ ํ•  ๊ฒƒ๋“ค๊ณผ ํ•„์ˆ˜ ๊ฐ€์ด๋“œ 5๊ฐ€์ง€๋ฅผ ์†Œ๊ฐœ ํ•ฉ๋‹ˆ๋‹ค. 

[์ธ์‚ฌ์ดํŠธ] ๋””์ง€ํ„ธ ๋งˆ์ผ€ํ„ฐ๊ฐ€ ์•Œ์•„์•ผ ํ•  GEM(Generative Ads Recommendation Model)์˜ ํ•ต์‹ฌ๊ณผ ์„ฑ๊ณผ ์ตœ์ ํ™” ์ „๋žต

 

[์ธ์‚ฌ์ดํŠธ] ๋””์ง€ํ„ธ ๋งˆ์ผ€ํ„ฐ๊ฐ€ ์•Œ์•„์•ผ ํ•  GEM(Generative Ads Recommendation Model)์˜ ํ•ต์‹ฌ๊ณผ ์„ฑ๊ณผ ์ตœ์ ํ™” ์ „

๐Ÿ’ก์ด๋ฒˆ ์ฝ˜ํ…์ธ ๋Š” Meta GEM: The Central Brain Accelerating Ads Recommendation AI Innovation ์˜ ๋‚ด์šฉ์„ ๊ธฐ๋ฐ˜์œผ๋กœ ๋””์ง€ํ„ธ๋งˆ์ผ€ํ„ฐ๊ฐ€ ์•Œ์•„์•ผํ•  GEM์˜ ํ•ต์‹ฌ์„ฑ๊ณผ ์ตœ์ ํ™” ์ „๋žต์„ ๊ตฌ์„ฑํ•˜์˜€์Šต๋‹ˆ๋‹ค. Meta์˜ GEM(Generative Ads Recomm

archives.flaneur.kr

 


๋ฉ”ํƒ€(Meta) ๊ด‘๊ณ  ์ƒํƒœ๊ณ„์˜ ์ง„ํ™”: GEM ๋ชจ๋ธ๊ณผ Andromeda ์—”์ง„์˜ ์ƒํ˜ธ์ž‘์šฉ ๋ฐ ์ตœ์ ํ™” ์ „๋žต

 

๋ฉ”ํƒ€(Meta) ๊ด‘๊ณ  ์ƒํƒœ๊ณ„์˜ ์ง„ํ™”: GEM ๋ชจ๋ธ๊ณผ Andromeda ์—”์ง„์˜ ์ƒํ˜ธ์ž‘์šฉ ๋ฐ ์ตœ์ ํ™” ์ „๋žต

1. ์•Œ๊ณ ๋ฆฌ์ฆ˜ ํŒจ๋Ÿฌ๋‹ค์ž„์˜ ๋Œ€์ „ํ™˜๊ณผ ๋ฏธ๋””์–ด ๋ฐ”์ž‰์˜ ์ข…๋ง2024๋…„ ํ•˜๋ฐ˜๊ธฐ๋ถ€ํ„ฐ 2025๋…„ ์ดˆ์— ๊ฑธ์ณ ๋ฉ”ํƒ€(Meta)์˜ ๊ด‘๊ณ  ํ”Œ๋žซํผ์€ ๋””์ง€ํ„ธ ๋งˆ์ผ€ํŒ… ์—ญ์‚ฌ์ƒ ๊ฐ€์žฅ ๊ทผ๋ณธ์ ์ด๊ณ  ๊ตฌ์กฐ์ ์ธ ๋ณ€ํ™”๋ฅผ ๋งž์ดํ–ˆ์Šต๋‹ˆ๋‹ค. ์ด๋Š”

archives.flaneur.kr

๋ฉ”ํƒ€ ๊ด‘๊ณ  ์•Œ๊ณ ๋ฆฌ์ฆ˜ GEM + Andromeda ์ตœ์ ํ™” ๊ฐ€์ด๋“œ

 

๋ฉ”ํƒ€ ๊ด‘๊ณ  ์•Œ๊ณ ๋ฆฌ์ฆ˜ GEM + Andromeda ์ตœ์ ํ™” ๊ฐ€์ด๋“œ

๐Ÿ’ก๋ฉ”ํƒ€ ๊ด‘๊ณ  ์•Œ๊ณ ๋ฆฌ์ฆ˜ GEM๊ณผ Andromeda ํ™œ์šฉ ์‹œ, ์ตœ์†Œ 5๊ฐœ ์ด์ƒ์˜ ์˜๋ฏธ๋ก ์ ์œผ๋กœ ๋‹ค์–‘ํ•œ ์†Œ์žฌ(5~15๊ฐœ ๊ถŒ์žฅ)๋ฅผ ํฌํ•จํ•˜๋Š” ๊ฒƒ์ด ์ค‘์š”ํ•ฉ๋‹ˆ๋‹ค. Andromeda ์—…๋ฐ์ดํŠธ ์ดํ›„ CTR ์ฆ๊ฐ€, CPA ๊ฐ์†Œ ๋“ฑ ์„ฑ๊ณผ ์ง€ํ‘œ๊ฐ€ ๊ฐœ์„ 

archives.flaneur.kr

์‹œํ€€์Šค ๋Ÿฌ๋‹: ๊ฐœ์ธํ™” ๊ด‘๊ณ  ์ถ”์ฒœ์„ ์œ„ํ•œ ํŒจ๋Ÿฌ๋‹ค์ž„์˜ ์ „ํ™˜ (Sequence learning: A paradigm shift for personalized ads recommendations)

 

์‹œํ€€์Šค ๋Ÿฌ๋‹: ๊ฐœ์ธํ™” ๊ด‘๊ณ  ์ถ”์ฒœ์„ ์œ„ํ•œ ํŒจ๋Ÿฌ๋‹ค์ž„์˜ ์ „ํ™˜ (Sequence learning: A paradigm shift for personalized

Executive Summary์ด ๋ฌธ์„œ๋Š” Meta๊ฐ€ ๊ฐœ์ธํ™” ๊ด‘๊ณ  ์ถ”์ฒœ ์‹œ์Šคํ…œ์„ ๊ธฐ์กด์˜ DLRM(Deep Learning Recommendation Models) ๋ฐฉ์‹์—์„œ ์‹œํ€€์Šค ๋Ÿฌ๋‹(Sequence Learning) ๊ธฐ๋ฐ˜์œผ๋กœ ์ „ํ™˜ํ•œ ๊ธฐ์ˆ ์  ๋ฐฐ๊ฒฝ๊ณผ ์„ฑ๊ณผ๋ฅผ ๋‹ค๋ฃน๋‹ˆ๋‹ค.๋ฌธ์ œ ์ •์˜

archives.flaneur.kr

 

 

 

 

 
๋ฐ˜์‘ํ˜•