Hỏi ChatGPT bao nhiêu lần mới biết thương hiệu được đề xuất ổn định?
Một lần xuất hiện chỉ là một quan sát. Dữ liệu repeated-run cho thấy tập nguồn và thương hiệu có thể thay đổi đáng kể, nên số lần chạy phải được chọn theo độ bất định chấp nhận được — đồng thời khóa prompt, môi trường, thời gian và cách chấm trước khi đo.
Xuất bản · Cập nhật
Câu trả lời nhanh
Số lần chạy phải đủ để thấy phân phối và khoảng bất định của chính prompt set. Khóa protocol trước, lưu cả lần không search/không nhắc, rồi tăng số run ở prompt quan trọng hoặc biến động cao.
Tác giả
Sam
LUMESEO
Sáng lập · 8 năm SEO · 3 năm AI engineering
Sam, sáng lập LUMESEO. Từ 2018 làm technical SEO và tăng trưởng xuất khẩu (index, IA, hreflang, GSC); từ 2023 làm cấu trúc trang và đo mẫu cho AI Search. Bài này do anh viết hoặc duyệt cuối. Dữ liệu từ thí nghiệm kiểm soát hoặc dự án ẩn danh — không cam kết thứ hạng hay được mô hình nêu tên.
Câu trả lời trực tiếp
Trong cohort đủ điều kiện của một preprint repeated-run, ChatGPT có source Jaccard trung bình 0,233 và brand Jaccard 0,437. Hai giá trị đến từ rule lọc khác nhau nên không phải matched effect. Chúng cho thấy lý do phải đo lặp, không cung cấp benchmark Việt Nam hay quy định “luôn chạy 10 lần”. Hãy bắt đầu bằng pilot lặp, đo độ biến động rồi quyết định sample size phù hợp với rủi ro và nguồn lực.
Phù hợp cho: Doanh nghiệp và agency Việt Nam đang báo cáo ChatGPT visibility bằng một ảnh chụp, một prompt hoặc một lần chạy.
Vì sao hỏi một lần tạo cảm giác chắc chắn giả?
Cùng prompt có thể đổi nguồn, thương hiệu, thứ tự hoặc không kích hoạt search giữa các lần. Nếu chỉ lưu lần đẹp nhất, dashboard biến biến động của hệ thống thành “thành tích” ổn định.
- Một run không cho biết variance.
- Đổi tài khoản, locale, web mode hoặc thời điểm làm phép đo khác đi.
- Chỉ giữ cited run làm mẫu số tăng selection bias.
- Mention không phải recommendation; recommendation không phải referral.
- Top order có thể đổi dù tập brand tương tự.
- Snapshot đẹp không đủ để đánh giá xu hướng.
Cách chúng tôi đọc và xử lý lại hai bảng
Nghiên cứu nguồn dùng tối đa 10 lần lặp đồng thời và chỉ ghép các lần trong cửa sổ 24 giờ. Paper báo 3.409 source pairs sau lọc trên bốn engine; tổng pair ở Bảng 5 cho ba brand campaign là 3.495. Bảng 6 không công bố pair count riêng của dòng ChatGPT, nên hai mean không có cùng mẫu số công khai. Jaccard đo phần giao của hai tập chia cho phần hợp; RBO đo độ giống của thứ tự, nhấn mạnh vị trí đầu.
Dữ liệu dùng trong phương pháp →01. Xác định đúng cohort
Source chỉ gồm run có ít nhất một citation; brand chỉ gồm campaign có detection trung bình ≥70%.
02. Giữ đúng metric
Không đổi Jaccard thành recommendation rate và không đổi RBO thành accuracy.
03. Chép giá trị và mẫu số
Lưu engine, campaign, pair count, max run, mean và SD; ghi rõ Bảng 6 không nêu pair count riêng cho ChatGPT.
04. Tính phần bù
1−Jaccard chỉ diễn đạt mức không giao nhau trung bình trong cohort đủ điều kiện.
05. Kiểm tra khả năng tái lập
Paper liên kết GitHub nhưng repository clone rỗng ngày 13-09-2026; vì vậy không tuyên bố row-level recomputation.
06. Chuyển thành protocol thực hành
Khóa prompt, chạy nhiều lần, lưu empty run và báo khoảng bất định.
Dữ liệu repeated-run và cách chọn phép đo của bạn
Dùng pilot để quyết định số lần lặp, không sao chép “5” hoặc “10” từ người khác
Chạy một nhóm prompt nhỏ qua nhiều ngày trong điều kiện đã khóa. Với mỗi prompt, ghi recommendation rate, source/brand overlap, no-search và khoảng bất định. Prompt ổn định, ít quan trọng có thể lấy mẫu thưa hơn; prompt thương mại quan trọng hoặc dao động mạnh cần nhiều lần hơn. Báo rõ số run thực tế cho từng prompt thay vì dùng một tổng chung che thiếu mẫu.
1. Mean của tập nguồn thấp hơn mean của tập thương hiệu
Source Jaccard của ChatGPT là 0,233 còn brand Jaccard là 0,437. Khoảng cách mô tả là 0,204, nhưng source và brand dùng rule lọc khác nhau và paper không công bố pair count riêng cho dòng ChatGPT. Vì vậy đây không phải matched effect và không ước lượng nguyên nhân.
2. Thứ tự top còn kém ổn định hơn sự hiện diện
RBO trung bình của ChatGPT là 0,088 cho nguồn và 0,192 cho brand. Jaccard trả lời “có chung phần tử nào”; RBO thấp cảnh báo rằng vị trí ưu tiên trong danh sách có thể thay đổi mạnh.
3. Độ ổn định khác nhau theo ngành
Brand Jaccard theo campaign là 0,477 cho điện tử tiêu dùng, 0,463 cho viễn thông và 0,327 cho đồ thể thao; SD xấp xỉ 0,30 ở cả ba. Không nên lấy một ngành làm chuẩn cho mọi thị trường.
4. Năm lần tốt hơn một, nhưng không tự động là đủ
Số run cần thiết phụ thuộc độ rộng khoảng tin cậy mong muốn, tỷ lệ xuất hiện và độ không ổn định theo thời gian. Một nghiên cứu liên quan cho rằng một số citation metric của SearchGPT có thể cần hàng chục đến hơn 100 query để khoảng ước lượng đủ hẹp.
5. Kết quả không phải benchmark Việt Nam
Dữ liệu được thu từ server Thụy Sĩ và các campaign tiêu dùng. Nó chứng minh vấn đề phương pháp — không đo một lần — chứ không cho biết tỷ lệ ổn định của prompt tiếng Việt hay B2B xuất khẩu.
Độ giao nhau trung bình theo nền tảng
| Nền tảng | Nguồn Jaccard | Nguồn RBO | Brand Jaccard | Brand RBO |
|---|---|---|---|---|
| ChatGPT | 0,233 | 0,088 | 0,437 | 0,192 |
| Perplexity | 0,282 | 0,102 | 0,492 | 0,202 |
| Gemini | 0,505 | 0,230 | 0,409 | 0,196 |
| Google AI Mode | 0,318 | 0,254 | 0,375 | 0,238 |
Source và brand có rule lọc khác nhau. Bảng 6 không công bố pair count riêng theo engine, vì vậy không dùng bảng để ước lượng matched effect hoặc xếp hạng chất lượng nền tảng.
Repeatability test
Repeatability test cho một bộ prompt thương mại
1 · Khóa điều kiện
- Lưu prompt nguyên văn, ngôn ngữ, locale, model, web mode và tiêu chí chấm.
- Định nghĩa brand alias và recommendation trước khi chạy.
- Không sửa prompt giữa cohort.
2 · Chạy pilot
- Trải run qua nhiều thời điểm thay vì bắn cùng lúc.
- Lưu no-search, lỗi và câu trả lời không nhắc.
- Giữ raw answer hoặc ledger đủ để audit.
3 · Chấm ổn định
- Tính recommendation rate trên mọi run đủ điều kiện.
- So brand/source set và vị trí khi cần.
- Báo khoảng tin cậy hoặc range, không chỉ điểm trung bình.
4 · Phân tầng prompt
- Tăng mẫu cho prompt quan trọng hoặc variance cao.
- Giảm tần suất cho prompt ổn định và ít giá trị.
- Tách discovery, comparison và provider-selection.
5 · Theo dõi thay đổi
- Tạo snapshot mới khi model/protocol/nội dung thay đổi.
- So cohort cùng điều kiện.
- Không hồi tố xóa run xấu.
Ví dụ tình huống
Ba cách một dashboard có thể đánh lừa người đọc
Run duy nhất
Tình huống: Brand xuất hiện 1/1 lần.
Cách làm: Chạy lại theo protocol cố định.
Kết quả: Có phân phối 2/10 hoặc 8/10 thay vì nhãn nhị phân.
Gộp mention với recommendation
Tình huống: ChatGPT nhắc tên trong phần cảnh báo nhưng dashboard tính là thắng.
Cách làm: Chấm vai trò của brand trong câu trả lời.
Kết quả: Recommendation rate không bị thổi phồng.
Ẩn lần không search
Tình huống: Chỉ run có citation được đưa vào biểu đồ.
Cách làm: Báo hai mẫu số: mọi run và cited run.
Kết quả: Người đọc thấy cả search activation lẫn source selection.
Checklist thực hiện
Checklist kiểm tra báo cáo AI visibility
- 01Có prompt nguyên văn?
- 02Có version model?
- 03Có ngày, locale và vị trí?
- 04Mỗi prompt chạy mấy lần?
- 05Có lưu no-answer/no-search?
- 06Mention và recommendation có tách?
- 07Có answer-level ledger?
- 08Có khoảng bất định?
- 09Có công bố thay đổi protocol?
- 10Có tách dữ liệu bên thứ ba và dữ liệu tự thu?
Giá trị công bố cho repeated-run cohort
Số lần lặp tối đa
10
Source pairs, 4 engine
3.409
Brand pairs, Bảng 5
3.495
ChatGPT source Jaccard
0,233
ChatGPT source RBO
0,088
ChatGPT brand Jaccard
0,437
ChatGPT brand RBO
0,192
Brand Jaccard thấp nhất theo campaign
0,327
Giá trị từ Bảng 5–6 của preprint. 3.409 là source pairs trên bốn engine; 3.495 là tổng brand pairs ở Bảng 5. Paper không nêu pair count riêng của ChatGPT ở Bảng 6, nên không coi hai mean là cùng mẫu số.
Bản trích xuất thứ cấp từ Bảng 5–6
Phiên bản dữ liệu: 2026-09-13-r2
Có trạng thái preprint, mẫu số công khai, giá trị bảng, phép tính mô tả, cảnh báo cohort và trạng thái raw repository.
Mở dataset JSONTối ưu cho xác suất lặp lại, không tối ưu cho một câu trả lời đẹp
Trang mạnh cần khớp một buyer task, đưa ra claim có thể kiểm tra và được xác nhận ở nhiều nguồn. Sau thay đổi, đo xem recommendation có lặp lại trên prompt family và nhiều snapshot hay không.
- Dùng prompt portfolio thay vì một câu hỏi thương hiệu.
- Giữ owner page ổn định và cập nhật theo event.
- Theo dõi brand, source và thứ tự riêng.
- Báo denominator của mọi rate.
- Dùng referral/lead để nối visibility với giá trị.
Đọc thêm
Đo mức độ được ChatGPT đề xuất
Khung chỉ số và prompt set cho doanh nghiệp Việt Nam.
30 câu hỏi buyer tìm nhà cung cấp Việt Nam
Bộ intent và evidence ledger công khai cho 10 ngành.
Dịch vụ Google SEO + ChatGPT GEO
Từ website, bằng chứng đến phép đo recommendation và referral.
Thương hiệu thủ công local SEO
Google Business Profile theo quận, không dịch nguyên site Trung.
Query Gate: có nên mở URL mới
Có intent tìm kiếm chưa đủ để tạo trang — phải qua cổng.
Giới hạn bắt buộc
- Hai nghiên cứu được dẫn là preprint arXiv, chưa phản biện ngang hàng.
- Dữ liệu server Thụy Sĩ, không phải người dùng Việt Nam.
- Campaign tiêu dùng, không đại diện B2B.
- Source và brand dùng rule lọc khác nhau; Bảng 6 không nêu pair count ChatGPT riêng.
- Jaccard/RBO không đo tính đúng.
- Model có thể đã thay đổi.
- Raw repository rỗng tại lần kiểm tra nên LUMESEO chỉ xác minh cấp bảng.
Cách thiết kế sample size thực dụng
Nguồn tham khảo
Câu hỏi thường gặp
Có phải luôn hỏi ChatGPT 10 lần không?
Không. 10 là thiết kế tối đa của nghiên cứu được đọc lại, không phải tiêu chuẩn chung. Hãy dùng pilot và độ bất định của prompt set để quyết định.
Một lần được đề xuất có đáng ghi nhận không?
Có thể ghi là một observation, nhưng không được gọi là trạng thái ổn định hoặc recommendation rate nếu chưa có mẫu số lặp.
Hỏi ChatGPT 5 lần có đủ không?
Tốt hơn một lần nhưng chưa có ngưỡng chung. Độ đủ phụ thuộc tỷ lệ quan sát, độ biến động và độ hẹp của khoảng tin cậy mà bạn cần.
Jaccard 0,233 có nghĩa 76,7% câu trả lời sai không?
Không. 0,233 đo mức giao nhau của tập nguồn giữa các cặp đủ điều kiện; nó không đo đúng/sai.
Tại sao brand ổn định hơn source?
Hai run có thể nhắc cùng thương hiệu nhưng chọn các URL/domain khác nhau để hỗ trợ câu trả lời.
Có thể dùng dữ liệu này làm benchmark Việt Nam không?
Không. Hãy dùng nó để thiết kế phép đo; benchmark Việt Nam cần prompt, locale và collection riêng.
Nên báo chỉ số nào ngoài visibility?
Recommendation rate, citation rate, source diversity, referral, lead và độ ổn định qua run.
Muốn đo ChatGPT bằng một protocol có thể kiểm tra?
LUMESEO giúp khóa prompt, môi trường, số lần lặp và ledger trước khi đo baseline.