Dữ liệu chính thức Việt Nam có dễ được AI trích dẫn không? Audit 48 URL
Nguồn chính thức có thẩm quyền nhưng không phải URL nào cũng dễ lấy và kiểm tra. Audit raw HTML cho thấy 46/48 URL trả 200 nhưng 24 có tín hiệu soft error/script shell. Doanh nghiệp nên giữ provenance rồi đóng gói lại số gốc thành một lớp phân tích có định nghĩa, kỳ, công thức và link sâu.
Xuất bản · Cập nhật
Câu trả lời nhanh
Đừng sao chép số rồi chỉ dẫn trang chủ cơ quan. Hãy lưu nguồn đúng kỳ, ghi định nghĩa và timezone, công khai phép lọc/công thức, tạo bảng HTML dễ đọc và nói rõ đâu là số gốc, số tính lại, suy luận.
Tác giả
Sam
LUMESEO
Sáng lập · 8 năm SEO · 3 năm AI engineering
Sam, sáng lập LUMESEO. Từ 2018 làm technical SEO và tăng trưởng xuất khẩu (index, IA, hreflang, GSC); từ 2023 làm cấu trúc trang và đo mẫu cho AI Search. Bài này do anh viết hoặc duyệt cuối. Dữ liệu từ thí nghiệm kiểm soát hoặc dự án ẩn danh — không cam kết thứ hạng hay được mô hình nêu tên.
Câu trả lời trực tiếp
Trong mẫu cố định, 46/48 URL trả status 200 nhưng 24 bị detector gắn soft error; manual subset chỉ có 4/8 raw response usable. Audit không đo AI citation thực tế. Điều doanh nghiệp kiểm soát được là tạo một trang phân tích bảo toàn đường đi từ claim → số đã xử lý → số gốc → URL/file chính thức, cùng kỳ dữ liệu và phép biến đổi.
Phù hợp cho: Đội research, content, PR và marketing Việt Nam dùng số liệu nhà nước trong bài GEO nhưng muốn tránh link homepage, số mất ngữ cảnh và bảng không tái lập.
Vì sao trích nguồn chính thức vẫn có thể tạo một trang khó được kiểm chứng?
URL có thể trả shell, WAF block, file không có landing context hoặc bảng chỉ xuất hiện sau JavaScript. Ngay cả khi người viết tải được số, người đọc và hệ thống AI còn cần biết số thuộc kỳ nào, đơn vị gì, đã lọc ra sao và claim nào nó hỗ trợ.
- HTTP 200 không chứng minh nội dung usable.
- Homepage không phải nguồn cho một số cụ thể.
- PDF/file thiếu landing context dễ bị tách khỏi kỳ và định nghĩa.
- Số đã xử lý không có formula/mapping khó tái lập.
- Null dễ bị biến thành 0.
- Schema không thay cho bảng, nguồn và provenance.
Common Crawl lập khung; raw HTML và manual subset để kiểm tra
Index query dùng status:200, mime:text/html và collapse=digest. Sau khi bỏ fragment, URL exact được khử trùng lặp bằng timestamp mới nhất; sắp theo officialUrlScore rồi timestamp giảm dần trước khi cắt 12. Detector chạy trên raw HTML. NSO không có capture trong query nên được ghi missing sampling frame, không tham gia bảng xếp hạng.
Dữ liệu dùng trong phương pháp →01. Khóa collection
Dùng CC-MAIN-2026-34 để tránh chọn URL tùy ý theo kết quả mong muốn.
02. Chọn URL phân tán
Lấy tối đa 12 HTML page/domain sau khi bỏ asset và URL trùng.
03. Fetch raw HTML
Theo redirect và lưu final URL, status, title, visible-text length; không dùng rendered DOM.
04. Chấm tám HTML signal
200; không soft error; title; date; canonical; table/download; JSON-LD; queryless + không noindex.
05. Kiểm tra thủ công 8 URL
Đọc raw HTML của hai URL đầu mỗi domain có mẫu: 4 usable, 2 thin shell, 2 request rejected.
06. Công khai sampling frame
Dataset giữ số record trước cắt 12, URL, detector rule, capture time, timezone UTC và giới hạn.
Kết quả audit và cách đóng gói dữ liệu cho người dùng
Doanh nghiệp nên tạo citation-ready analysis, không tạo bản sao dữ liệu nhà nước
Giữ nguồn chính thức làm neo cho số gốc; phần information gain của bạn nằm ở việc chọn đúng tập, chuẩn hóa đơn vị, giải thích định nghĩa, ghép nguồn, tính chỉ số và chuyển nó thành quyết định cho một đối tượng cụ thể. Trang phải cho phép người đọc lần ngược mọi số quan trọng về file/bảng gốc mà không giả vờ rằng dữ liệu chính thức do doanh nghiệp sở hữu.
1. 46 status 200; 24 raw response có tín hiệu soft error
12 SBV trả trang “Request Rejected”; 12 Customs có dưới 100 ký tự visible text trong raw HTML. Detector có thể bỏ sót soft error khác, nhưng đủ để bác bỏ cách đọc “status 200 = nội dung hoạt động”.
2. Canonical tập trung ở một nguồn
10/48 trang có canonical và cả 10 thuộc mẫu Bộ Công Thương. Các nguồn khác có 0 trong 12 URL được chọn. Hai URL MOIT không trả phản hồi đọc được trong lần fetch nên là unknown, không bị tính thành thiếu canonical.
3. Dấu ngày xuất hiện ở 22/48 raw response
10 URL Bộ Công Thương và 12 URL Cổng Thông tin Chính phủ có date marker. Hải quan và Ngân hàng Nhà nước không có trong raw HTML mẫu; hai MOIT không fetch được là unknown.
4. Bảng hoặc download xuất hiện ở 15/48
Cổng Thông tin Chính phủ có 12/12 và Bộ Công Thương 3/12 theo detector. Một link tài liệu không tự nó chứng minh dữ liệu dễ đọc; nhưng nó cho máy và người dùng đường dẫn tới vật chứng.
5. JSON-LD là 0/48
Không trang nào trong mẫu live chứa JSON-LD. Đây là cơ hội cải thiện Article/Dataset/Report metadata, nhưng Schema chỉ nên phản ánh nội dung thật và không thay thế bảng hoặc file nguồn.
6. Manual review xác nhận status không đủ
Trong 8 URL được đọc thủ công ở raw HTML, hai URL Bộ Công Thương và hai URL Cổng Thông tin Chính phủ có nội dung usable; hai Customs là thin script shell; hai SBV là request rejected. Kết quả chỉ áp dụng cho tám URL, không được ngoại suy toàn domain.
7. NSO là missing frame, không phải điểm 0
Common Crawl collection cố định không trả capture cho nso.gov.vn trong truy vấn của nghiên cứu, nên NSO có n=0 và bị loại khỏi so sánh score. Chúng tôi không đổi sang search engine để lấp mẫu sau khi thấy kết quả.
Sampling frame trước khi cắt tối đa 12 URL mỗi domain
| Nguồn | Record sau collapse=digest | URL distinct trước truncation | URL chọn |
|---|---|---|---|
| Cơ quan Thống kê Quốc gia | 0 | 0 | 0 |
| Bộ Công Thương | 4.879 | 4.845 | 12 |
| Hải quan Việt Nam | 12 | 12 | 12 |
| Ngân hàng Nhà nước | 4.556 | 4.555 | 12 |
| Cổng Thông tin Chính phủ | 286 | 284 | 12 |
Collection CC-MAIN-2026-34; URL exact sau khi bỏ fragment được giữ theo timestamp mới nhất. NSO là missing frame, không phải score 0.
Kết quả manual review raw HTML trên tám URL
| Nguồn | Đã xem | Usable | Thin shell | Request rejected |
|---|---|---|---|---|
| Bộ Công Thương | 2 | 2 | 0 | 0 |
| Hải quan Việt Nam | 2 | 0 | 2 | 0 |
| Ngân hàng Nhà nước | 2 | 0 | 0 | 2 |
| Cổng Thông tin Chính phủ | 2 | 2 | 0 | 0 |
Hai URL đầu trong thứ tự chọn của mỗi domain có mẫu; verdict chỉ áp dụng cho tám raw response được kiểm tra, không đại diện toàn domain.
HTML signal theo bốn nguồn có sampling frame
| Nguồn | N | Soft error | Canonical | Ngày | Bảng/download | Median |
|---|---|---|---|---|---|---|
| Bộ Công Thương | 12 | 0 | 10 | 10 | 3 | 6/8 |
| Hải quan Việt Nam | 12 | 12 | 0 | 0 | 0 | 2/8 |
| Ngân hàng Nhà nước | 12 | 12 | 0 | 0 | 0 | 3/8 |
| Cổng Thông tin Chính phủ | 12 | 0 | 0 | 12 | 12 | 6/8 |
NSO được ghi riêng là missing sampling frame (0 capture trong query), không xếp hạng. Median dùng HTML signal score, không phải citation score.
Citable-data packaging
Citable-data packaging từ nguồn Việt Nam
1 · Xác định claim
- Viết claim và decision mà số sẽ hỗ trợ.
- Chọn cơ quan có thẩm quyền cho đúng phạm vi.
- Không gom nhiều nguồn khác định nghĩa vào một chỉ số.
2 · Chụp provenance
- Lưu URL/file/bảng, kỳ, ngày truy xuất, đơn vị và timezone.
- Ghi status/render issue nếu có.
- Không thay missing bằng 0.
3 · Xử lý minh bạch
- Công khai filter, mapping, formula và rounding.
- Tách raw value khỏi derived value.
- Version dataset và change log.
4 · Xuất bản HTML
- Quick answer kèm điều kiện.
- Bảng đọc được, định nghĩa cột và link sâu.
- Canonical, ngày và Schema phản ánh nội dung thật.
5 · Kiểm lại
- Reviewer lần ngược sample số về nguồn.
- Kiểm link/file sau update event.
- Ghi nguồn biến mất hoặc thay đổi thay vì âm thầm sửa.
Ví dụ tình huống
Ba cấp độ sử dụng nguồn
Link trang chủ cơ quan
Tình huống: Bài nói một con số nhưng chỉ dẫn về homepage.
Cách làm: Tìm URL báo cáo/bảng/file đúng kỳ.
Kết quả: Nguồn hỗ trợ trực tiếp claim thay vì chỉ chứng minh cơ quan tồn tại.
PDF không có landing page
Tình huống: File có dữ liệu nhưng thiếu mô tả và canonical.
Cách làm: Tạo trang phân tích riêng, ghi file gốc, trang/bảng và phép tính.
Kết quả: Người đọc và AI có ngữ cảnh để kiểm tra.
Bảng đã xử lý
Tình huống: Nhiều nguồn và mã ngành cần ghép.
Cách làm: Công khai mapping, null và version dataset.
Kết quả: Phần information gain có thể tái lập.
Checklist thực hiện
Checklist nguồn trước khi xuất bản
- 01Nguồn có đúng thẩm quyền?
- 02URL dẫn tới đúng bảng/file?
- 03Có kỳ và timezone?
- 04Canonical có rõ?
- 05Số gốc và số tính lại đã tách?
- 06Null có bị đổi thành 0?
- 07Có link tải hoặc bảng đọc được?
- 08Dataset xử lý có version và giới hạn?
Kết quả audit 48 raw response
URL được lấy mẫu
48
HTTP status 200
46
Soft error detector
24
Manual usable
4/8
Có canonical
10
Có dấu ngày
22
Có bảng/download
15
Có JSON-LD
0
Median HTML signal
3/8
NSO có N=0 do missing sampling frame trong collection/query và không tham gia so sánh. HTTP status, HTML signal và manual verdict là ba trường riêng.
Ledger sampling frame, 48 raw response và 8 manual review
Phiên bản dữ liệu: 2026-09-10-r2
Có số URL trước truncation, selection rule, detector raw HTML, soft error, manual verdict, canonical, date, table, download, JSON-LD và HTML signal score.
Mở dataset JSONCitation-ready không đồng nghĩa nhồi Schema
Schema giúp mô tả Article/Dataset/Table, nhưng passage được dùng vẫn cần nêu rõ số, mẫu số, kỳ, địa lý, công thức và provenance trong HTML. Đây mới là lớp giúp người dùng kiểm tra và AI trích đúng ngữ cảnh.
- Link sâu, không link homepage.
- Đặt định nghĩa ngay cạnh bảng.
- Cho tải dataset đã xử lý khi phù hợp.
- Giữ URL dài hạn và version.
- Nêu limitation trước khi người đọc suy rộng.
Đọc thêm
Kim ngạch × domain trong 30 prompt buyer
Ví dụ ghép nguồn công với bộ prompt buyer.
News domain × số prompt trong nhóm đã xuất hiện
Phân biệt nguồn quan sát được và xác suất shortlist.
30 câu hỏi buyer tìm nhà cung cấp Việt Nam qua AI
Evidence Ledger công khai cho 10 ngành và 30 câu hỏi mua hàng quốc tế.
Đo mức độ được ChatGPT đề xuất
Tách nhắc tên, đề xuất, trích dẫn và lượt vào website thành các chỉ số riêng.
Dịch vụ Google SEO + ChatGPT GEO
Xây hệ thống nội dung có thể được tìm thấy, kiểm chứng và đo lường.
Thương hiệu thủ công local SEO
Google Business Profile theo quận, không dịch nguyên site Trung.
Giới hạn của audit hạ tầng công
- Common Crawl không thu thập toàn bộ web; không có capture không đồng nghĩa không crawl được.
- Mỗi domain tối đa 12 URL nên kết quả phản ánh template được chọn.
- Detector chạy trên raw HTML, không phải rendered DOM.
- Chỉ 8/48 URL được kiểm tra thủ công; detector có thể bỏ sót soft error.
- HTML signal score không đo độ đúng, độ uy tín, AI retrieval hay xác suất citation.
- Các website và collection có thể thay đổi sau snapshot.
Chuỗi provenance tối thiểu
Nguồn tham khảo
Câu hỏi thường gặp
Nguồn chính thức có chắc được ChatGPT trích dẫn không?
Không. Thẩm quyền, khả năng truy cập, mức liên quan và cách hệ thống retrieval chọn nguồn là các lớp khác nhau; audit này chỉ đo raw HTML signal.
Có nên sao chép toàn bộ bảng dữ liệu nhà nước?
Không mặc định. Hãy tuân thủ quyền sử dụng, chỉ xử lý phần phục vụ quyết định, giữ provenance và link về nguồn gốc.
Nguồn điểm 6/8 có chắc được ChatGPT trích dẫn không?
Không. Score chỉ đo tám tín hiệu HTML. Việc được chọn còn phụ thuộc truy vấn, nội dung, độ liên quan và hệ thống retrieval.
Vì sao NSO không được chấm?
Collection Common Crawl cố định không trả URL trong khung lấy mẫu. Gán 0 sẽ biến thiếu dữ liệu thành thất bại, nên nghiên cứu ghi N/A.
Có nên sao chép nguyên dữ liệu nhà nước lên website?
Không. Hãy tuân thủ quyền sử dụng, dẫn nguồn, giữ provenance và chỉ xuất bản phần xử lý có giá trị rõ ràng.
Muốn biết website của bạn đang thiếu điều kiện nào để được AI đề xuất?
Gửi website và thị trường mục tiêu; LUMESEO sẽ tách riêng khả năng truy cập, nhận diện thực thể, bằng chứng độc lập và nội dung hỗ trợ quyết định.