1. 目的
本報告以自然語言處理(Natural Language Processing, NLP)方法,分析 hahababy YouTube 頻道的影片逐字稿(transcript)與觀眾留言(comment),試圖回答以下問題:
- hahababy 的語料由哪些主題構成?內容主題與觀眾討論主題是否一致?
- 短影片、一般影片、直播三種子集的主題與對齊度有何差異?
- 品牌是否具備可識別的設計理念、視覺風格與設計方法論?
- 觀眾對 hahababy 原創性與 SOU・SOU 相似性的質疑,是否在語料中有跡象?
- hahababy 的設計話語與日本 / 法國 ready-to-wear(RTW)品牌有何結構性差異?
本報告僅基於文字語料進行分析,不做圖像、產品照片或法律層面的比對。所有數字均來自 output/ 與 data/ 中的實際輸出檔案。
2. 資料來源
| 檔案 | 內容 | 用途 |
|---|---|---|
data/videos.parquet |
341 部影片的 metadata(upload_date、view_count、like_count、comment_count、duration、live_status 等) |
影片分類、互動分析、對齊子集 |
data/comments.parquet |
觀眾留言原始資料 | 觀眾話語 |
data/transcripts.parquet / data/transcripts_clean.parquet |
自動語音辨識(ASR)逐字稿 | 主持人內容話語 |
data/unified_meta.parquet |
23,236 份文件的統一後設資料(含 doc_id、video_id、source、text、segmented_text) |
統一語料 |
data/unified_embeddings.npy |
qwen3-embedding-8b 產生的 4096 維向量,已 L2 正規化 | 語意表徵與對齊 |
data/chinese_stopwords.txt |
中文停用詞表 | 傳統 NLP 特徵過濾 |
output/reports/02_topic_gap.md |
主題落差分析 | 內容 vs 留言主題分離 |
output/reports/13_subset_alignment.md |
三子集對齊度報告 | 子集對齊比較 |
output/reports/20_traditional_nlp_features.md |
傳統 NLP 特徵摘要 | 詞頻 / n-gram / LDA |
output/reports/15_design_clothing_guigui_report.md |
服飾 design topic 與貴貴設計師 | 服飾設計話語 |
output/reports/17_comprehensive_guigui_designer_report.md |
貴貴設計師綜合分析 | 貴貴產品與互動 |
output/reports/19_design_philosophy.md |
創作理念與設計想法 | 功能性設計論述 |
output/reports/21_aesthetic_design_philosophy.md |
產品美學設計理念 | 視覺風格與外部影響 |
output/reports/22_hahababy_design_originality_assessment.md |
設計方法論與原創性總評 | 原創性 / SOU・SOU / RTW 比較 |
output/reports/14_sou_sou_event.md |
SOU・SOU 爭議事件分析 | 事件驅動話語 |
3. 資料範圍
3.1 影片與文件規模
| 指標 | 數值 |
|---|---|
| 影片總數 | 341 部 |
| 統一後文件總數 | 23,236 份 |
| 其中 transcript(逐字稿 chunk) | 9,479 份 |
| 其中 comment(留言 / 直播聊天) | 13,757 份 |
有文件覆蓋的 unique video_id |
338 部 |
分析期間(依 upload_date) |
2023-03-27 至 2026-07-07(41 個活躍月份) |
3.2 子集分類
依 live_status 與 duration 分為三類:
| 子集 | 影片數 | 文件數 | transcript | comment | 備註 |
|---|---|---|---|---|---|
| short(< 90s) | 170 | 1,271 | 110 | 1,161 | 人格 IP / 演算法曝光 |
| regular video(>= 90s 且非直播) | 67 | 12,289 | 308 | 11,981 | 內容核心、高留言 |
livestream(was_live) |
104 | 9,676 | 9,061 | 615 | 帶貨現場、長時直播 |
註:short 170 支、livestream 104 支、regular video 67 支為實際分類結果,文件數為 data/unified_meta.parquet 中與該子集影片對應的文件總數。
3.3 語意向量
| 項目 | 數值 |
|---|---|
| 模型 | qwen3-embedding-8b(透過 OpenRouter API) |
| 向量維度 | 4096-d |
| 儲存路徑 | data/unified_embeddings.npy |
| 正規化 | 已 L2 正規化,因此 Euclidean distance 與 cosine distance 一對一對應 |
3.4 傳統 NLP 特徵
已為以下 6 個子集建立 unigram / bigram / trigram / TF-IDF / BM25 / LDA 特徵,輸出於 output/nlp/{subset}/:
all:23,236 docstranscript:9,479 docscomment:13,757 docsshort:1,271 docsregular:12,289 docslivestream:9,676 docs
| 參數 | 設定 |
|---|---|
| 停用詞 | data/chinese_stopwords.txt |
| MAX_FEATURES | 5,000 |
| MIN_DF | 2 |
| n-gram | unigram、bigram、trigram |
| 特徵表示 | count、TF-IDF、BM25 |
| LDA 主題數 | 20,max_iter = 5 |
LDA 結果位於 output/nlp/lda/lda_{all|transcript|comment}_topics.csv 與 lda_*_doc_topics.csv。
詞頻 / n-gram 示例
unigram 前 5(count)
| 子集 | top unigrams |
|---|---|
| all | 應該(7,492)、大(7,180)、裡面(7,107)、一樣(6,924)、剛剛(6,058) |
| transcript | 應該(7,313)、裡面(7,069)、大(6,990)、一樣(6,824)、剛剛(6,028) |
| comment | 安全帽(2,152)、辛苦(1,340)、新品(1,125)、聯名(1,122)、珍煮丹(1,095) |
| short | 讚(112)、可愛(92)、二伯(59)、大(43)、生日快樂(39) |
| regular | 安全帽(2,201)、辛苦(1,292)、聯名(1,146)、新品(1,115)、珍煮丹(1,087) |
| livestream | 應該(7,158)、裡面(6,888)、大(6,802)、一樣(6,696)、剛剛(5,893) |
bigram / trigram 示例(transcript)
- bigram:大 姐姐(569)、一樣 一樣(549)、擁抱 點點(541)、大 大(482)、愛心 餅乾(432)
- trigram:一樣 一樣 一樣(110)、大 大 大(81)、禮拜 禮拜 禮拜(74)、補 補 補(72)、抽 抽 抽(66)
TF-IDF 示例(all):安全帽(0.0265)、辛苦(0.0196)、可愛(0.0174)、新品(0.0160)、聯名(0.0152)。
4. 計算方法
4.1 資料流程
download.sh下載影片 metadata 與音檔。consolidate.py產生data/videos.parquet、data/comments.parquet、data/transcripts.parquet。clean_hallucinations.py清理 ASR 幻覺,build_transcripts_ckip_ready.py產生分段語料。run_ckip_mlx.py/run_comments_ckip_mlx.py進行 CKIP 斷詞,產生segmented_text。run_embeddings.py/run_comments_embeddings.py以qwen3-embedding-8b產生 4096-d 向量。build_unified.py合併為data/unified_meta.parquet與data/unified_embeddings.npy,並以 CKIP 詞性過濾「1 字非動詞中文字」。
4.2 MLX BERTopic 主題建模
本研究使用本地修補版 MLX BERTopic(位於 mlx-bertopic/,源於 https://github.com/mlx-bertopic/mlx-bertopic)作為 canonical topic model 後端,核心組件均針對 Apple Silicon 以 MLX 重新實作:
| 模組 | 實作 | 參數 |
|---|---|---|
| 降維 | MlxUMAP |
n_neighbors=15、n_components=5、min_dist=0.0 |
| 聚類 | MlxHDBSCAN |
min_cluster_size=30、min_samples=5、metric=euclidean |
| 詞頻 | CountVectorizer |
輸入 segmented_text |
| 主題表示 | MlxCTFIDF |
bm25_weighting=True、reduce_frequent_words=True |
建模結果:
- 初始 BERTopic 產出 148 個 active topics + -1 outlier,共 149 列。
- 以 OpenRouter
gpt-4o-mini為 132 個主題產生可讀的llm_label(見output/topic_info_clean.csv)。 - 離群值再分配:透過
mlx_bertopic.reduce_outliers_embeddings,以 cosine threshold 0.68 對 outlier 文件做 embedding-based 重新指派,將 canonical-1文件數從 7,723 降至 887(output/topic_info_clean.csv)。
4.3 主題相似度與對齊度
主題相似度(Topic Gap)
-
對每個主題計算
comment_share = comment_docs / (comment_docs + transcript_docs)。 -
對每支同時具有兩種來源的影片(n=269),將 transcript 與 comment 的主題計數正規化為機率分布 P、Q,在主題聯集詞彙表上計算對稱 Jensen-Shannon divergence:
JS(P||Q) = 1/2 KL(P||M) + 1/2 KL(Q||M), M = 1/2(P+Q) -
JS 範圍為 [0, ln2≈0.693],值越大代表內容主題與留言主題差異越大。
對齊度(Alignment)
- 對每支影片,計算該影片下所有 transcript chunk 嵌入的平均向量與所有 comment 嵌入的平均向量之 cosine similarity。
- 輸出至
output/alignment_scores.parquet。 - 根據影片長度與 chunk 數進行 multi-chunk / single-chunk 分層,避免 single-chunk 的退化估計。
4.4 主要輸出檔案
| 檔案 | 內容 |
|---|---|
output/topic_info.csv |
BERTopic 原始主題資訊 |
output/topic_info_clean.csv |
離群值再分配後 + LLM 標籤的主題資訊 |
output/topics_assigned.parquet |
每份文件的主題指派 |
output/topics_per_class.csv |
依 source(transcript / comment)彙整的 top words |
output/alignment_scores.parquet |
每支影片的 cosine alignment |
output/viz/ |
互動圖表(topic_source_scatter.html、js_divergence_hist.html 等) |
5. 大主題發現
5.1 主題總覽
| 指標 | 數值 |
|---|---|
| 總文件數 | 23,236 |
| 有效主題數(不含 -1) | 148 |
| LLM 標籤主題數 | 132 |
| 離群值 -1 文件數(再分配後) | 887 |
| Top-10 主題佔有效文件比 | 24.2% |
| HHI | 0.0141(等效主題數 ≈ 71) |
5.2 Top 15 主題(依 total_docs)
| topic | llm_label | total_docs | comment_share | 簡述 |
|---|---|---|---|---|
| 0 | 高雄觀光 | 1,104 | 0.985 | 觀眾對「尋找 hahababy」系列的地標反應與社群互動 |
| -1 | 離群值(未分類) | 887 | 0.645 | 離群值再分配後的剩餘雜訊 / 跨主題閒聊 |
| 2 | 安全帽製作 | 767 | 0.995 | 觀眾對 MIT 安全帽、手作工廠的驕傲與情緒回饋 |
| 12 | 兒童洋裝 | 752 | 0.007 | 直播帶貨中的童裝尺寸、花色、價格規格 |
| 1 | Hahababy故事 | 684 | 0.923 | 品牌故事、活動、社群認同與觀眾應援 |
| 23 | 內衣搭配 | 559 | 0.002 | 直播中的 bra-top、內衣尺寸與穿搭 |
| 3 | 酵素產品 | 505 | 0.014 | 食品 / 保健商品的成分、優惠與試吃 |
| 13 | 牛仔外套 | 496 | 0.004 | 牛仔系列商品的版型、顏色、價格 |
| 4 | 背帶包設計 | 492 | 0.035 | 包包 / 平板套等配件的規格與贈品 |
| 5 | 搞笑互動 | 449 | 0.989 | 觀眾情緒互動、幽默回饋、節目效果 |
| 6 | 乳液優惠 | 411 | 0.012 | 保養品的功效、優惠與贈品 |
| 24 | 手機配件 | 405 | 0.020 | 手機周邊、行動電源、保護殼規格 |
| 48 | 幽默反應 | 400 | 0.998 | 觀眾表情符號與社群玩笑 |
| 7 | 直播測試 | 359 | 0.942 | 開播測試、閒聊與觀眾等待互動 |
| 25 | 假日活動 | 337 | 0.985 | 節慶活動、路跑、線下見面的觀眾回饋 |
來源:output/topic_info_clean.csv,以 total_docs 取前 15 名。
5.3 主題落差:內容 vs 留言幾乎是兩個宇宙
整體 comment_share 基線為 0.592,但主題分布呈現明顯雙峰:
| 指標 | 數值 |
|---|---|
純留言主題(comment_share > 0.85 且 n > 50) |
59 個,涵蓋 10,468 份 comment 文件(佔留言量 76.1%) |
純內容主題(comment_share < 0.15 且 n > 50) |
45 個,涵蓋 8,530 份 transcript 文件(佔逐字稿量 90.0%) |
| 全體平均 JS divergence(n=269) | 0.627 |
| 中位數 JS divergence | 0.693(接近理論最大值 ln2) |
| 主題集合完全不相交的影片占比 | 61.0% |
代表性分離主題:
- 觀眾主導:T0(高雄觀光 / 觀眾情緒互動,1,087 comment / 17 transcript,
comment_share=0.985)、T2(安全帽製作,763 / 4,comment_share=0.995)。 - 內容主導:T12(兒童洋裝,747 / 5,
comment_share=0.007)、T23(內衣搭配,558 / 1,comment_share=0.002)、T3(酵素產品,498 / 7,comment_share=0.014)。
這顯示 BERTopic 幾乎將「逐字稿話語」(帶貨規格、商品價格、ASR 雜訊)與「留言話語」(情緒反應、MIT 應援、品牌驕傲)切為兩個近乎不重疊的主題空間。
6. 子集主題發現
6.1 對齊度比較(依影片子集)
對於同時有 transcript 與 comment 的影片(n=269),依 duration 與 live_status 分組後的對齊度如下:
| 子集 | n(有對齊分數的影片) | mean alignment | median alignment | 解讀 |
|---|---|---|---|---|
| short | 104 | 0.509 | 0.521 | 單 chunk 為主,ASR 雜訊多,對齊度最低 |
| regular video | 67 | 0.765 | 0.778 | 內容經過剪輯,主題集中,對齊度最高 |
| livestream | 98 | 0.674 | 0.693 | 直播話題集中但隨時間飄移,對齊度居中 |
來源:output/reports/13_subset_alignment.md 與 output/alignment_scores.parquet 實際計算。
6.2 三子集的角色
| 子集 | 影片數 | 文件數 | 主題特徵 | 內容 vs 留言重疊 |
|---|---|---|---|---|
| short | 170 | 1,271 | 人格 IP(嘎嫂二伯)、表情符號、生日祝賀、短促情緒 | transcript 過少,難以計算有意義的主題重疊 |
| regular video | 67 | 12,289 | 出任務、尋找 hahababy、安全帽、哈姆咖啡、日常 vlog、MIT 應援 | 向量對齊高(0.765),但離散 topic 重疊仍低(Jaccard ≈ 0.063) |
| livestream | 104 | 9,676 | 尺寸 / 身高 / 體重、價格、訂單、bra-top、促銷 | 幾乎完全分離:host 講商品,觀眾聊社交,0/20 主題重疊 |
6.3 子集主題示例
- shorts 熱門主題:人格 IP、節慶生日、表情互動、可愛與讚;97% 僅 1 個 transcript chunk,導致 alignment 結構性失效。
- regular video 熱門主題:安全帽製作、MIT 工廠、尋找 hahababy、哈姆咖啡開幕、日常系列;這些影片貢獻頻道 57% 觀看、85% 常規留言。
- livestream 熱門主題:尺寸與顏色選擇、bratop、價格規格、補貨通知、路跑活動;逐字稿幾乎全為帶貨語言,留言卻以社交閒聊為主。
7. 特殊主題與概念再分析
7.1 服飾 design topic 是設計話語主力
output/reports/15_design_clothing_guigui_report.md 與 output/reports/17_comprehensive_guigui_designer_report.md 顯示:
- 前 10 大 design topics 中有 9 個與服飾相關,合計 matched docs 2,017。
- 全部服飾 design topics 共 9 個,主題包括:兒童洋裝、內衣搭配、牛仔外套、尺寸與顏色選擇、布拉托內衣、服裝尺寸建議、睡衣搭配、服裝搭配、服裝設計細節。
- 服飾圖案語言高度重疊:點點、新花開、愛心餅乾、迷藏兔、擁抱點點、皇冠點點、條紋、滿版、小怪獸。
7.2 貴貴設計師:首席設計師,但主要「畫圖 → 印成產品」
| 指標 | 數值 |
|---|---|
| 以正則 `貴貴 | 菜頭貴 |
| HDBSCAN 聚類數 | 4 個 cluster(0、1、2、3),另含 -1 離群值 |
| 貴貴產品相關影片數 | 14 支 |
| 貴貴產品影片總觀看 | 240,343 |
| 貴貴產品影片平均觀看 | 17,167(約為全頻道平均的 46%) |
| 觀眾留言情緒 | 可愛(6 則)、帥(5 則)、設計(1 則)、畫(1 則)、喜歡(2 則) |
直接證據顯示直播主多次稱貴貴為「首席設計師」「貴貴設計師」,並將其畫作印在 T 恤上銷售(貴貴T、貴貴設計師T)。然而貴貴的角色更接近「畫圖 → 印花應用」,而非系統性的服裝設計論述。
7.3 功能性設計理念 vs 視覺風格標籤
依 output/reports/19_design_philosophy.md 與 output/reports/21_aesthetic_design_philosophy.md:
| 層級 | 內容 | 數量 |
|---|---|---|
| 功能性 / 規格理念 | MIT、純棉、舒適、親子、環保、媽媽代工、在地廠商 | 最多(19_design_philosophy.md 收錄 303 條帶設計意圖的語句) |
| 視覺風格標籤 | 可愛、繽紛、撞色、點點、新花開、貴貴圖畫、日系清爽 | 中等(21_aesthetic_design_philosophy.md 共 1,960 則,其中圖案與印花 661 則、品牌視覺風格 472 則、顏色與配色 382 則) |
| 設計方法論 / 概念敘事 | 設計過程、季節主題、版型研究、材質實驗、樣衣 | 幾乎沒有 |
搜尋設計方法論相關詞彙的結果:
研究方法|設計研究|靈感|mood board|概念板|主題|collection|系列主題:100 筆打版|版型研究|剪裁|silhouette|輪廓:54 筆面料開發|材質實驗|布料研究|sample|樣衣:39 筆設計師訪談|創作過程|設計理念|設計概念|設計方法:9 筆
相較之下,顏色、版型、尺寸、材質、舒服、可愛、點點 等銷售導向詞彙出現數千次。
7.4 SOU・SOU 爭議與日本趨勢參考
output/reports/22_hahababy_design_originality_assessment.md、output/reports/21_aesthetic_design_philosophy.md 與 output/reports/14_sou_sou_event.md 顯示:
- 日系參考:直播主多次提及「日本現在很流行這個款式」「日式版型」「羽織」「風呂夫」「日本一個都上千塊,台灣生產所以便宜」等。
- 抄襲指控:觀眾留言中至少出現 12 則明確提及 SOU・SOU 或高度相似指控。
- 標的事件:video_id
UP7gGlPEldI(《出任務#30》台灣製手工包包)在 2026-07 爆發爭議,上架後 30–60 天留言量達 208 則,為同齡影片中位數 26 則的 8.2 倍。 - 品牌回應:在 corpus 範圍內,未見 hahababy 對 SOU・SOU 相似爭議的官方回應逐字內容;僅見強調「台灣製造」「貴貴設計師」「自己畫的圖案」。
7.5 與日本 / 法國 ready-to-wear 的比較
| 維度 | hahababy | 日本 / 法國 RTW |
|---|---|---|
| 設計主體 | 家庭 IP / 直播主 / 貴貴畫圖 | 設計師 / 創意總監 / 工作室 |
| 概念敘事 | 無系統性季節主題 | 每季有明確主題與靈感來源 |
| 方法論揭露 | 無:沒有設計過程、研究、樣衣說明 | 有:設計師訪談、工作室紀錄、秀場 / lookbook |
| 版型 / 剪裁 | 基本款為主,強調寬鬆、舒適 | 常有輪廓實驗、結構設計 |
| 視覺語言 | 印花 + 配色 + 可愛形容詞 | 材質、色彩、輪廓、概念整合 |
| 與外部風格關係 | 跟隨日系 / 日本流行,觀眾質疑與 SOU・SOU 相似 | 會明確標示參考 / 致敬 / 聯名關係 |
8. 結論
8.1 總結
hahababy 擁有明確的產品主題與市場識別,但在設計方法論與原創性論述上明顯薄弱。資料顯示:
- 它更像是一個以家庭 IP 與直播電商為核心的產品策展品牌,而非由設計師主導、以概念敘事推動的時裝品牌。
- 主題模型清楚區分出「帶貨規格話語」(transcript 主導)與「情緒應援話語」(comment 主導),兩者在多數影片中幾乎不重疊。
- 設計話語集中在功能性與規格性論述(MIT、純棉、舒適、親子),視覺風格以可愛、撞色、點點、貴貴圖畫等風格標籤為主,缺乏設計過程、季節主題、版型研究等方法論敘事。
- 貴貴被賦予「首席設計師」稱號,但實際角色更接近「畫圖 → 印花商品化」。
- 日系 / 日本趨勢在直播中被頻繁引用,觀眾留言中亦存在明確的 SOU・SOU / 抄襲指控;corpus 中未見品牌方對爭議的正面回應。
- NLP 無法驗證視覺抄襲:本分析只能指出語料中的指控與風格參考,不能證明或否定圖像層級的複製。
8.2 限制
- 未做圖像比對:未包含產品照片、花色 / 圖案的視覺相似度比對。
- 未納入外部官方資料:官網、公關稿、媒體採訪、設計師專訪等不在 corpus 內。
- 無銷售數據:無訂單、轉換率、營收資料,無法評估商業表現。
upload_date異常:部分影片標示 2026 年等未來日期,時間趨勢僅供參考,需以內容進一步校驗。- ASR 品質與多語言雜訊:部分 transcript 含有英文 / 韓文歌詞或 ASR 幻覺,可能影響主題純度。
本報告數字已根據 output/topic_info_clean.csv、output/alignment_scores.parquet、data/unified_meta.parquet、data/videos.parquet 與 output/reports/ 相關檔案核實。