LUMESEO
phân tích độ ổn định AI SearchSnapshot 13-09-2026ChatGPTrepeated samplingJaccardRBOAI visibilityThời gian đọc 24 phút

Hỏi ChatGPT bao nhiêu lần mới biết thương hiệu được đề xuất ổn định?

Một lần xuất hiện chỉ là một quan sát. Dữ liệu repeated-run cho thấy tập nguồn và thương hiệu có thể thay đổi đáng kể, nên số lần chạy phải được chọn theo độ bất định chấp nhận được — đồng thời khóa prompt, môi trường, thời gian và cách chấm trước khi đo.

Xuất bản · Cập nhật

Câu trả lời nhanh

Số lần chạy phải đủ để thấy phân phối và khoảng bất định của chính prompt set. Khóa protocol trước, lưu cả lần không search/không nhắc, rồi tăng số run ở prompt quan trọng hoặc biến động cao.

Tác giả

Sam

LUMESEO

Sáng lập · 8 năm SEO · 3 năm AI engineering

Sam, sáng lập LUMESEO. Từ 2018 làm technical SEO và tăng trưởng xuất khẩu (index, IA, hreflang, GSC); từ 2023 làm cấu trúc trang và đo mẫu cho AI Search. Bài này do anh viết hoặc duyệt cuối. Dữ liệu từ thí nghiệm kiểm soát hoặc dự án ẩn danh — không cam kết thứ hạng hay được mô hình nêu tên.

Câu trả lời trực tiếp

Trong cohort đủ điều kiện của một preprint repeated-run, ChatGPT có source Jaccard trung bình 0,233 và brand Jaccard 0,437. Hai giá trị đến từ rule lọc khác nhau nên không phải matched effect. Chúng cho thấy lý do phải đo lặp, không cung cấp benchmark Việt Nam hay quy định “luôn chạy 10 lần”. Hãy bắt đầu bằng pilot lặp, đo độ biến động rồi quyết định sample size phù hợp với rủi ro và nguồn lực.

Phù hợp cho: Doanh nghiệp và agency Việt Nam đang báo cáo ChatGPT visibility bằng một ảnh chụp, một prompt hoặc một lần chạy.

Vì sao hỏi một lần tạo cảm giác chắc chắn giả?

Cùng prompt có thể đổi nguồn, thương hiệu, thứ tự hoặc không kích hoạt search giữa các lần. Nếu chỉ lưu lần đẹp nhất, dashboard biến biến động của hệ thống thành “thành tích” ổn định.

  • Một run không cho biết variance.
  • Đổi tài khoản, locale, web mode hoặc thời điểm làm phép đo khác đi.
  • Chỉ giữ cited run làm mẫu số tăng selection bias.
  • Mention không phải recommendation; recommendation không phải referral.
  • Top order có thể đổi dù tập brand tương tự.
  • Snapshot đẹp không đủ để đánh giá xu hướng.

Cách chúng tôi đọc và xử lý lại hai bảng

Nghiên cứu nguồn dùng tối đa 10 lần lặp đồng thời và chỉ ghép các lần trong cửa sổ 24 giờ. Paper báo 3.409 source pairs sau lọc trên bốn engine; tổng pair ở Bảng 5 cho ba brand campaign là 3.495. Bảng 6 không công bố pair count riêng của dòng ChatGPT, nên hai mean không có cùng mẫu số công khai. Jaccard đo phần giao của hai tập chia cho phần hợp; RBO đo độ giống của thứ tự, nhấn mạnh vị trí đầu.

Dữ liệu dùng trong phương pháp →

01. Xác định đúng cohort

Source chỉ gồm run có ít nhất một citation; brand chỉ gồm campaign có detection trung bình ≥70%.

02. Giữ đúng metric

Không đổi Jaccard thành recommendation rate và không đổi RBO thành accuracy.

03. Chép giá trị và mẫu số

Lưu engine, campaign, pair count, max run, mean và SD; ghi rõ Bảng 6 không nêu pair count riêng cho ChatGPT.

04. Tính phần bù

1−Jaccard chỉ diễn đạt mức không giao nhau trung bình trong cohort đủ điều kiện.

05. Kiểm tra khả năng tái lập

Paper liên kết GitHub nhưng repository clone rỗng ngày 13-09-2026; vì vậy không tuyên bố row-level recomputation.

06. Chuyển thành protocol thực hành

Khóa prompt, chạy nhiều lần, lưu empty run và báo khoảng bất định.

Dữ liệu repeated-run và cách chọn phép đo của bạn

Dùng pilot để quyết định số lần lặp, không sao chép “5” hoặc “10” từ người khác

Chạy một nhóm prompt nhỏ qua nhiều ngày trong điều kiện đã khóa. Với mỗi prompt, ghi recommendation rate, source/brand overlap, no-search và khoảng bất định. Prompt ổn định, ít quan trọng có thể lấy mẫu thưa hơn; prompt thương mại quan trọng hoặc dao động mạnh cần nhiều lần hơn. Báo rõ số run thực tế cho từng prompt thay vì dùng một tổng chung che thiếu mẫu.

1. Mean của tập nguồn thấp hơn mean của tập thương hiệu

Source Jaccard của ChatGPT là 0,233 còn brand Jaccard là 0,437. Khoảng cách mô tả là 0,204, nhưng source và brand dùng rule lọc khác nhau và paper không công bố pair count riêng cho dòng ChatGPT. Vì vậy đây không phải matched effect và không ước lượng nguyên nhân.

2. Thứ tự top còn kém ổn định hơn sự hiện diện

RBO trung bình của ChatGPT là 0,088 cho nguồn và 0,192 cho brand. Jaccard trả lời “có chung phần tử nào”; RBO thấp cảnh báo rằng vị trí ưu tiên trong danh sách có thể thay đổi mạnh.

3. Độ ổn định khác nhau theo ngành

Brand Jaccard theo campaign là 0,477 cho điện tử tiêu dùng, 0,463 cho viễn thông và 0,327 cho đồ thể thao; SD xấp xỉ 0,30 ở cả ba. Không nên lấy một ngành làm chuẩn cho mọi thị trường.

4. Năm lần tốt hơn một, nhưng không tự động là đủ

Số run cần thiết phụ thuộc độ rộng khoảng tin cậy mong muốn, tỷ lệ xuất hiện và độ không ổn định theo thời gian. Một nghiên cứu liên quan cho rằng một số citation metric của SearchGPT có thể cần hàng chục đến hơn 100 query để khoảng ước lượng đủ hẹp.

5. Kết quả không phải benchmark Việt Nam

Dữ liệu được thu từ server Thụy Sĩ và các campaign tiêu dùng. Nó chứng minh vấn đề phương pháp — không đo một lần — chứ không cho biết tỷ lệ ổn định của prompt tiếng Việt hay B2B xuất khẩu.

Độ giao nhau trung bình theo nền tảng

Độ giao nhau trung bình theo nền tảng
Nền tảngNguồn JaccardNguồn RBOBrand JaccardBrand RBO
ChatGPT0,2330,0880,4370,192
Perplexity0,2820,1020,4920,202
Gemini0,5050,2300,4090,196
Google AI Mode0,3180,2540,3750,238

Source và brand có rule lọc khác nhau. Bảng 6 không công bố pair count riêng theo engine, vì vậy không dùng bảng để ước lượng matched effect hoặc xếp hạng chất lượng nền tảng.

Repeatability test

Repeatability test cho một bộ prompt thương mại

1 · Khóa điều kiện

  • Lưu prompt nguyên văn, ngôn ngữ, locale, model, web mode và tiêu chí chấm.
  • Định nghĩa brand alias và recommendation trước khi chạy.
  • Không sửa prompt giữa cohort.

2 · Chạy pilot

  • Trải run qua nhiều thời điểm thay vì bắn cùng lúc.
  • Lưu no-search, lỗi và câu trả lời không nhắc.
  • Giữ raw answer hoặc ledger đủ để audit.

3 · Chấm ổn định

  • Tính recommendation rate trên mọi run đủ điều kiện.
  • So brand/source set và vị trí khi cần.
  • Báo khoảng tin cậy hoặc range, không chỉ điểm trung bình.

4 · Phân tầng prompt

  • Tăng mẫu cho prompt quan trọng hoặc variance cao.
  • Giảm tần suất cho prompt ổn định và ít giá trị.
  • Tách discovery, comparison và provider-selection.

5 · Theo dõi thay đổi

  • Tạo snapshot mới khi model/protocol/nội dung thay đổi.
  • So cohort cùng điều kiện.
  • Không hồi tố xóa run xấu.

Ví dụ tình huống

Ba cách một dashboard có thể đánh lừa người đọc

Run duy nhất

Tình huống: Brand xuất hiện 1/1 lần.

Cách làm: Chạy lại theo protocol cố định.

Kết quả: Có phân phối 2/10 hoặc 8/10 thay vì nhãn nhị phân.

Gộp mention với recommendation

Tình huống: ChatGPT nhắc tên trong phần cảnh báo nhưng dashboard tính là thắng.

Cách làm: Chấm vai trò của brand trong câu trả lời.

Kết quả: Recommendation rate không bị thổi phồng.

Ẩn lần không search

Tình huống: Chỉ run có citation được đưa vào biểu đồ.

Cách làm: Báo hai mẫu số: mọi run và cited run.

Kết quả: Người đọc thấy cả search activation lẫn source selection.

Checklist thực hiện

Checklist kiểm tra báo cáo AI visibility

  • 01Có prompt nguyên văn?
  • 02Có version model?
  • 03Có ngày, locale và vị trí?
  • 04Mỗi prompt chạy mấy lần?
  • 05Có lưu no-answer/no-search?
  • 06Mention và recommendation có tách?
  • 07Có answer-level ledger?
  • 08Có khoảng bất định?
  • 09Có công bố thay đổi protocol?
  • 10Có tách dữ liệu bên thứ ba và dữ liệu tự thu?

Giá trị công bố cho repeated-run cohort

Số lần lặp tối đa

10

Source pairs, 4 engine

3.409

Brand pairs, Bảng 5

3.495

ChatGPT source Jaccard

0,233

ChatGPT source RBO

0,088

ChatGPT brand Jaccard

0,437

ChatGPT brand RBO

0,192

Brand Jaccard thấp nhất theo campaign

0,327

Giá trị từ Bảng 5–6 của preprint. 3.409 là source pairs trên bốn engine; 3.495 là tổng brand pairs ở Bảng 5. Paper không nêu pair count riêng của ChatGPT ở Bảng 6, nên không coi hai mean là cùng mẫu số.

Bản trích xuất thứ cấp từ Bảng 5–6

Phiên bản dữ liệu: 2026-09-13-r2

Có trạng thái preprint, mẫu số công khai, giá trị bảng, phép tính mô tả, cảnh báo cohort và trạng thái raw repository.

Mở dataset JSON

Tối ưu cho xác suất lặp lại, không tối ưu cho một câu trả lời đẹp

Trang mạnh cần khớp một buyer task, đưa ra claim có thể kiểm tra và được xác nhận ở nhiều nguồn. Sau thay đổi, đo xem recommendation có lặp lại trên prompt family và nhiều snapshot hay không.

  • Dùng prompt portfolio thay vì một câu hỏi thương hiệu.
  • Giữ owner page ổn định và cập nhật theo event.
  • Theo dõi brand, source và thứ tự riêng.
  • Báo denominator của mọi rate.
  • Dùng referral/lead để nối visibility với giá trị.

Giới hạn bắt buộc

  • Hai nghiên cứu được dẫn là preprint arXiv, chưa phản biện ngang hàng.
  • Dữ liệu server Thụy Sĩ, không phải người dùng Việt Nam.
  • Campaign tiêu dùng, không đại diện B2B.
  • Source và brand dùng rule lọc khác nhau; Bảng 6 không nêu pair count ChatGPT riêng.
  • Jaccard/RBO không đo tính đúng.
  • Model có thể đã thay đổi.
  • Raw repository rỗng tại lần kiểm tra nên LUMESEO chỉ xác minh cấp bảng.

Cách thiết kế sample size thực dụng

Một lần chỉ dùng để debug.
Pilot nhiều lần để thấy variance.
Prompt quan trọng/dao động cao cần nhiều mẫu hơn.
Lưu mọi outcome, kể cả no-search.
Không so hai kỳ nếu protocol đã đổi.

Nguồn tham khảo

  1. 01Schulte, Bleeker & Kaufmann — Don’t Measure Once (preprint, chưa phản biện ngang hàng)
  2. 02Quantifying Uncertainty in AI Visibility (preprint, chưa phản biện ngang hàng)
  3. 03OpenAI — tổng quan ChatGPT Search

Câu hỏi thường gặp

Có phải luôn hỏi ChatGPT 10 lần không?

Không. 10 là thiết kế tối đa của nghiên cứu được đọc lại, không phải tiêu chuẩn chung. Hãy dùng pilot và độ bất định của prompt set để quyết định.

Một lần được đề xuất có đáng ghi nhận không?

Có thể ghi là một observation, nhưng không được gọi là trạng thái ổn định hoặc recommendation rate nếu chưa có mẫu số lặp.

Hỏi ChatGPT 5 lần có đủ không?

Tốt hơn một lần nhưng chưa có ngưỡng chung. Độ đủ phụ thuộc tỷ lệ quan sát, độ biến động và độ hẹp của khoảng tin cậy mà bạn cần.

Jaccard 0,233 có nghĩa 76,7% câu trả lời sai không?

Không. 0,233 đo mức giao nhau của tập nguồn giữa các cặp đủ điều kiện; nó không đo đúng/sai.

Tại sao brand ổn định hơn source?

Hai run có thể nhắc cùng thương hiệu nhưng chọn các URL/domain khác nhau để hỗ trợ câu trả lời.

Có thể dùng dữ liệu này làm benchmark Việt Nam không?

Không. Hãy dùng nó để thiết kế phép đo; benchmark Việt Nam cần prompt, locale và collection riêng.

Nên báo chỉ số nào ngoài visibility?

Recommendation rate, citation rate, source diversity, referral, lead và độ ổn định qua run.

Muốn đo ChatGPT bằng một protocol có thể kiểm tra?

LUMESEO giúp khóa prompt, môi trường, số lần lặp và ledger trước khi đo baseline.