LUMESEO
audit crawl + extraction readinessSnapshot 10-09-2026Common Crawlraw HTMLsoft errorgovernment dataThời gian đọc 28 phút

Dữ liệu chính thức Việt Nam có dễ được AI trích dẫn không? Audit 48 URL

Nguồn chính thức có thẩm quyền nhưng không phải URL nào cũng dễ lấy và kiểm tra. Audit raw HTML cho thấy 46/48 URL trả 200 nhưng 24 có tín hiệu soft error/script shell. Doanh nghiệp nên giữ provenance rồi đóng gói lại số gốc thành một lớp phân tích có định nghĩa, kỳ, công thức và link sâu.

Xuất bản · Cập nhật

Câu trả lời nhanh

Đừng sao chép số rồi chỉ dẫn trang chủ cơ quan. Hãy lưu nguồn đúng kỳ, ghi định nghĩa và timezone, công khai phép lọc/công thức, tạo bảng HTML dễ đọc và nói rõ đâu là số gốc, số tính lại, suy luận.

Tác giả

Sam

LUMESEO

Sáng lập · 8 năm SEO · 3 năm AI engineering

Sam, sáng lập LUMESEO. Từ 2018 làm technical SEO và tăng trưởng xuất khẩu (index, IA, hreflang, GSC); từ 2023 làm cấu trúc trang và đo mẫu cho AI Search. Bài này do anh viết hoặc duyệt cuối. Dữ liệu từ thí nghiệm kiểm soát hoặc dự án ẩn danh — không cam kết thứ hạng hay được mô hình nêu tên.

Câu trả lời trực tiếp

Trong mẫu cố định, 46/48 URL trả status 200 nhưng 24 bị detector gắn soft error; manual subset chỉ có 4/8 raw response usable. Audit không đo AI citation thực tế. Điều doanh nghiệp kiểm soát được là tạo một trang phân tích bảo toàn đường đi từ claim → số đã xử lý → số gốc → URL/file chính thức, cùng kỳ dữ liệu và phép biến đổi.

Phù hợp cho: Đội research, content, PR và marketing Việt Nam dùng số liệu nhà nước trong bài GEO nhưng muốn tránh link homepage, số mất ngữ cảnh và bảng không tái lập.

Vì sao trích nguồn chính thức vẫn có thể tạo một trang khó được kiểm chứng?

URL có thể trả shell, WAF block, file không có landing context hoặc bảng chỉ xuất hiện sau JavaScript. Ngay cả khi người viết tải được số, người đọc và hệ thống AI còn cần biết số thuộc kỳ nào, đơn vị gì, đã lọc ra sao và claim nào nó hỗ trợ.

  • HTTP 200 không chứng minh nội dung usable.
  • Homepage không phải nguồn cho một số cụ thể.
  • PDF/file thiếu landing context dễ bị tách khỏi kỳ và định nghĩa.
  • Số đã xử lý không có formula/mapping khó tái lập.
  • Null dễ bị biến thành 0.
  • Schema không thay cho bảng, nguồn và provenance.

Common Crawl lập khung; raw HTML và manual subset để kiểm tra

Index query dùng status:200, mime:text/html và collapse=digest. Sau khi bỏ fragment, URL exact được khử trùng lặp bằng timestamp mới nhất; sắp theo officialUrlScore rồi timestamp giảm dần trước khi cắt 12. Detector chạy trên raw HTML. NSO không có capture trong query nên được ghi missing sampling frame, không tham gia bảng xếp hạng.

Dữ liệu dùng trong phương pháp →

01. Khóa collection

Dùng CC-MAIN-2026-34 để tránh chọn URL tùy ý theo kết quả mong muốn.

02. Chọn URL phân tán

Lấy tối đa 12 HTML page/domain sau khi bỏ asset và URL trùng.

03. Fetch raw HTML

Theo redirect và lưu final URL, status, title, visible-text length; không dùng rendered DOM.

04. Chấm tám HTML signal

200; không soft error; title; date; canonical; table/download; JSON-LD; queryless + không noindex.

05. Kiểm tra thủ công 8 URL

Đọc raw HTML của hai URL đầu mỗi domain có mẫu: 4 usable, 2 thin shell, 2 request rejected.

06. Công khai sampling frame

Dataset giữ số record trước cắt 12, URL, detector rule, capture time, timezone UTC và giới hạn.

Kết quả audit và cách đóng gói dữ liệu cho người dùng

Doanh nghiệp nên tạo citation-ready analysis, không tạo bản sao dữ liệu nhà nước

Giữ nguồn chính thức làm neo cho số gốc; phần information gain của bạn nằm ở việc chọn đúng tập, chuẩn hóa đơn vị, giải thích định nghĩa, ghép nguồn, tính chỉ số và chuyển nó thành quyết định cho một đối tượng cụ thể. Trang phải cho phép người đọc lần ngược mọi số quan trọng về file/bảng gốc mà không giả vờ rằng dữ liệu chính thức do doanh nghiệp sở hữu.

1. 46 status 200; 24 raw response có tín hiệu soft error

12 SBV trả trang “Request Rejected”; 12 Customs có dưới 100 ký tự visible text trong raw HTML. Detector có thể bỏ sót soft error khác, nhưng đủ để bác bỏ cách đọc “status 200 = nội dung hoạt động”.

2. Canonical tập trung ở một nguồn

10/48 trang có canonical và cả 10 thuộc mẫu Bộ Công Thương. Các nguồn khác có 0 trong 12 URL được chọn. Hai URL MOIT không trả phản hồi đọc được trong lần fetch nên là unknown, không bị tính thành thiếu canonical.

3. Dấu ngày xuất hiện ở 22/48 raw response

10 URL Bộ Công Thương và 12 URL Cổng Thông tin Chính phủ có date marker. Hải quan và Ngân hàng Nhà nước không có trong raw HTML mẫu; hai MOIT không fetch được là unknown.

4. Bảng hoặc download xuất hiện ở 15/48

Cổng Thông tin Chính phủ có 12/12 và Bộ Công Thương 3/12 theo detector. Một link tài liệu không tự nó chứng minh dữ liệu dễ đọc; nhưng nó cho máy và người dùng đường dẫn tới vật chứng.

5. JSON-LD là 0/48

Không trang nào trong mẫu live chứa JSON-LD. Đây là cơ hội cải thiện Article/Dataset/Report metadata, nhưng Schema chỉ nên phản ánh nội dung thật và không thay thế bảng hoặc file nguồn.

6. Manual review xác nhận status không đủ

Trong 8 URL được đọc thủ công ở raw HTML, hai URL Bộ Công Thương và hai URL Cổng Thông tin Chính phủ có nội dung usable; hai Customs là thin script shell; hai SBV là request rejected. Kết quả chỉ áp dụng cho tám URL, không được ngoại suy toàn domain.

7. NSO là missing frame, không phải điểm 0

Common Crawl collection cố định không trả capture cho nso.gov.vn trong truy vấn của nghiên cứu, nên NSO có n=0 và bị loại khỏi so sánh score. Chúng tôi không đổi sang search engine để lấp mẫu sau khi thấy kết quả.

Sampling frame trước khi cắt tối đa 12 URL mỗi domain

Sampling frame trước khi cắt tối đa 12 URL mỗi domain
NguồnRecord sau collapse=digestURL distinct trước truncationURL chọn
Cơ quan Thống kê Quốc gia000
Bộ Công Thương4.8794.84512
Hải quan Việt Nam121212
Ngân hàng Nhà nước4.5564.55512
Cổng Thông tin Chính phủ28628412

Collection CC-MAIN-2026-34; URL exact sau khi bỏ fragment được giữ theo timestamp mới nhất. NSO là missing frame, không phải score 0.

Kết quả manual review raw HTML trên tám URL

Kết quả manual review raw HTML trên tám URL
NguồnĐã xemUsableThin shellRequest rejected
Bộ Công Thương2200
Hải quan Việt Nam2020
Ngân hàng Nhà nước2002
Cổng Thông tin Chính phủ2200

Hai URL đầu trong thứ tự chọn của mỗi domain có mẫu; verdict chỉ áp dụng cho tám raw response được kiểm tra, không đại diện toàn domain.

HTML signal theo bốn nguồn có sampling frame

HTML signal theo bốn nguồn có sampling frame
NguồnNSoft errorCanonicalNgàyBảng/downloadMedian
Bộ Công Thương120101036/8
Hải quan Việt Nam12120002/8
Ngân hàng Nhà nước12120003/8
Cổng Thông tin Chính phủ120012126/8

NSO được ghi riêng là missing sampling frame (0 capture trong query), không xếp hạng. Median dùng HTML signal score, không phải citation score.

Citable-data packaging

Citable-data packaging từ nguồn Việt Nam

1 · Xác định claim

  • Viết claim và decision mà số sẽ hỗ trợ.
  • Chọn cơ quan có thẩm quyền cho đúng phạm vi.
  • Không gom nhiều nguồn khác định nghĩa vào một chỉ số.

2 · Chụp provenance

  • Lưu URL/file/bảng, kỳ, ngày truy xuất, đơn vị và timezone.
  • Ghi status/render issue nếu có.
  • Không thay missing bằng 0.

3 · Xử lý minh bạch

  • Công khai filter, mapping, formula và rounding.
  • Tách raw value khỏi derived value.
  • Version dataset và change log.

4 · Xuất bản HTML

  • Quick answer kèm điều kiện.
  • Bảng đọc được, định nghĩa cột và link sâu.
  • Canonical, ngày và Schema phản ánh nội dung thật.

5 · Kiểm lại

  • Reviewer lần ngược sample số về nguồn.
  • Kiểm link/file sau update event.
  • Ghi nguồn biến mất hoặc thay đổi thay vì âm thầm sửa.

Ví dụ tình huống

Ba cấp độ sử dụng nguồn

Link trang chủ cơ quan

Tình huống: Bài nói một con số nhưng chỉ dẫn về homepage.

Cách làm: Tìm URL báo cáo/bảng/file đúng kỳ.

Kết quả: Nguồn hỗ trợ trực tiếp claim thay vì chỉ chứng minh cơ quan tồn tại.

PDF không có landing page

Tình huống: File có dữ liệu nhưng thiếu mô tả và canonical.

Cách làm: Tạo trang phân tích riêng, ghi file gốc, trang/bảng và phép tính.

Kết quả: Người đọc và AI có ngữ cảnh để kiểm tra.

Bảng đã xử lý

Tình huống: Nhiều nguồn và mã ngành cần ghép.

Cách làm: Công khai mapping, null và version dataset.

Kết quả: Phần information gain có thể tái lập.

Checklist thực hiện

Checklist nguồn trước khi xuất bản

  • 01Nguồn có đúng thẩm quyền?
  • 02URL dẫn tới đúng bảng/file?
  • 03Có kỳ và timezone?
  • 04Canonical có rõ?
  • 05Số gốc và số tính lại đã tách?
  • 06Null có bị đổi thành 0?
  • 07Có link tải hoặc bảng đọc được?
  • 08Dataset xử lý có version và giới hạn?

Kết quả audit 48 raw response

URL được lấy mẫu

48

HTTP status 200

46

Soft error detector

24

Manual usable

4/8

Có canonical

10

Có dấu ngày

22

Có bảng/download

15

Có JSON-LD

0

Median HTML signal

3/8

NSO có N=0 do missing sampling frame trong collection/query và không tham gia so sánh. HTTP status, HTML signal và manual verdict là ba trường riêng.

Ledger sampling frame, 48 raw response và 8 manual review

Phiên bản dữ liệu: 2026-09-10-r2

Có số URL trước truncation, selection rule, detector raw HTML, soft error, manual verdict, canonical, date, table, download, JSON-LD và HTML signal score.

Mở dataset JSON

Citation-ready không đồng nghĩa nhồi Schema

Schema giúp mô tả Article/Dataset/Table, nhưng passage được dùng vẫn cần nêu rõ số, mẫu số, kỳ, địa lý, công thức và provenance trong HTML. Đây mới là lớp giúp người dùng kiểm tra và AI trích đúng ngữ cảnh.

  • Link sâu, không link homepage.
  • Đặt định nghĩa ngay cạnh bảng.
  • Cho tải dataset đã xử lý khi phù hợp.
  • Giữ URL dài hạn và version.
  • Nêu limitation trước khi người đọc suy rộng.

Giới hạn của audit hạ tầng công

  • Common Crawl không thu thập toàn bộ web; không có capture không đồng nghĩa không crawl được.
  • Mỗi domain tối đa 12 URL nên kết quả phản ánh template được chọn.
  • Detector chạy trên raw HTML, không phải rendered DOM.
  • Chỉ 8/48 URL được kiểm tra thủ công; detector có thể bỏ sót soft error.
  • HTML signal score không đo độ đúng, độ uy tín, AI retrieval hay xác suất citation.
  • Các website và collection có thể thay đổi sau snapshot.

Chuỗi provenance tối thiểu

Claim cần hỗ trợ.
Số đã xử lý và công thức.
Số gốc, đơn vị và kỳ.
URL/file chính thức.
Snapshot, version và giới hạn.

Nguồn tham khảo

  1. 01Common Crawl — bắt đầu sử dụng dữ liệu
  2. 02Common Crawl — URL Index
  3. 03Cơ quan Thống kê Quốc gia — xuất nhập khẩu
  4. 04Bộ Công Thương
  5. 05Hải quan Việt Nam
  6. 06Ngân hàng Nhà nước
  7. 07Cổng Thông tin Chính phủ
  8. 08Dataset — audit 48 URL nguồn chính thức

Câu hỏi thường gặp

Nguồn chính thức có chắc được ChatGPT trích dẫn không?

Không. Thẩm quyền, khả năng truy cập, mức liên quan và cách hệ thống retrieval chọn nguồn là các lớp khác nhau; audit này chỉ đo raw HTML signal.

Có nên sao chép toàn bộ bảng dữ liệu nhà nước?

Không mặc định. Hãy tuân thủ quyền sử dụng, chỉ xử lý phần phục vụ quyết định, giữ provenance và link về nguồn gốc.

Nguồn điểm 6/8 có chắc được ChatGPT trích dẫn không?

Không. Score chỉ đo tám tín hiệu HTML. Việc được chọn còn phụ thuộc truy vấn, nội dung, độ liên quan và hệ thống retrieval.

Vì sao NSO không được chấm?

Collection Common Crawl cố định không trả URL trong khung lấy mẫu. Gán 0 sẽ biến thiếu dữ liệu thành thất bại, nên nghiên cứu ghi N/A.

Có nên sao chép nguyên dữ liệu nhà nước lên website?

Không. Hãy tuân thủ quyền sử dụng, dẫn nguồn, giữ provenance và chỉ xuất bản phần xử lý có giá trị rõ ràng.

Muốn biết website của bạn đang thiếu điều kiện nào để được AI đề xuất?

Gửi website và thị trường mục tiêu; LUMESEO sẽ tách riêng khả năng truy cập, nhận diện thực thể, bằng chứng độc lập và nội dung hỗ trợ quyết định.