Trích xuất URL từ sitemap

Nhập địa chỉ tệp sitemap.xml hoặc dán nội dung của nó: mọi URL sẽ hiện ra, mỗi dòng một URL, sẵn sàng để sao chép, sắp xếp hoặc phân tích.

Nội dung XML
URL đã trích xuất
0 URL trích xuất được 0 URL duy nhất loại tệp: chưa có

Danh sách trang của một website, chỉ trong một thao tác

Sitemap của một website là mỏ vàng cho việc kiểm tra SEO: nó cho thấy số lượng trang thực tế, cách tổ chức và đôi khi cả những chuyên mục bị lãng quên. Công cụ này trích xuất toàn bộ địa chỉ bằng cách đọc các thẻ "loc" trong XML, dù đó là sitemap chứa danh sách trang hay sitemap index, và trả về cho bạn một danh sách gọn gàng, mỗi dòng một URL.

Việc lấy dữ liệu trực tiếp qua địa chỉ chỉ hoạt động khi website cho phép đọc từ tên miền khác; nếu không, chỉ cần sao chép và dán nội dung XML là đủ, và mọi dữ liệu đều ở lại trong trình duyệt của bạn, đúng theo chính sách bảo mật của chúng tôi. Khi đã có danh sách, công cụ sắp xếp danh sách của chúng tôi sẽ phân loại và loại bỏ trùng lặp, còn công cụ đếm cho bạn biết vừa thu về được bao nhiêu trang.

Câu hỏi thường gặp

Sitemap.xml là gì?

Sitemap là một tệp XML liệt kê các trang của một website dành cho công cụ tìm kiếm. Tệp này thường nằm ở thư mục gốc của website, ví dụ vidu.vn/sitemap.xml, và mỗi địa chỉ được đặt trong một thẻ loc. Công cụ này đọc các thẻ đó và trả về cho bạn danh sách URL thô.

Vì sao đôi khi việc lấy dữ liệu qua địa chỉ bị thất bại?

Trình duyệt chỉ có thể đọc tệp từ một website khác nếu website đó cho phép (quy tắc bảo mật CORS). Nhiều website không cho phép điều này. Trong trường hợp đó, hãy mở sitemap trong một thẻ mới, sao chép nội dung và dán vào ô XML: việc trích xuất khi đó luôn thành công.

Công cụ có xử lý được sitemap index không?

Có. Nếu tệp là một index (danh sách các sitemap thay vì danh sách trang), công cụ sẽ tự nhận biết và trích xuất địa chỉ của các sitemap con. Sau đó bạn có thể xử lý từng sitemap con theo cùng cách để lấy URL của các trang.