Curso Web Scraping para SEO – Clase 7

Obtener metatag title   En cada página vamos a obtener el título incluido en el tag html <title>    # -*- coding: iso-8859-15 -*- # Proyecto Web Scraping para SEO con Python # Clase 7: Obtener metatag title# webscrap7 import urllib import re url_sitio = “https://evginformatica.blogspot.com/” url_inicio=url_sitio lista_enlaces = []…

Curso Web Scraping para SEO – Clase 6

Buscar todos los enlaces internos   A partir del paso anterior buscaremos todos los enlaces internos del sitio web, recorriendo cada página que encontremos y buscando enlaces dentro.   # -*- coding: iso-8859-15 -*- # Proyecto Web Scraping para SEO con Python # Clase 6: Buscar todos los enlaces internos#…

Curso Web Scraping para SEO – Clase 5

Crear lista de enlaces válidos   De los enlaces obtenidos anteriormente vamos a descartar algunos que no son páginas web o son usados para búsquedas. Los enlaces obtenidos los pondremos en una lista   # -*- coding: iso-8859-15 -*- # Proyecto Web Scraping para SEO con Python # Clase 5:…

Curso Web Scraping para SEO – Clase 4

Decodificar enlaces y ver acentos   En este paso vamos a sustituir los caracteres especiales decodificando los enlaces   # -*- coding: iso-8859-15 -*- # Proyecto Web Scraping para SEO con Python # Clase 4: Decodificar enlaces y ver acentos # webscrap4 import urllib import re url = “https://evginformatica.blogspot.com/” htmluni = urllib.urlopen(url).read()…

Curso Web Scraping para SEO – Clase 3

Obtener enlaces internos de una página web   Una vez leído el contenido de la página web vamos a extraer los enlaces internos. Buscaremos las etiquetas html de la forma <a href=’…..’ que se dirijan a nuestro sitio web   # -*- coding: iso-8859-15 -*- # Proyecto Web Scraping para…