Парсинг из Json с использованием beautifulsoup и urllibPython

Программы на Python
Anonymous
Парсинг из Json с использованием beautifulsoup и urllib

Сообщение Anonymous »

Я изучаю парсинг на примере веб-сайта, использующего json. Например, возьмем следующий пример веб-сайта: http://www.charitystars.com/product/juv ... -chiellini. Исходный код находится здесь: https://www.charitystars.com/product/ju ... -chiellini. Я хотел бы получить информацию по строкам 388-396:

Код: Выделить всё

var js_data = {"first_time_bid":true,"yourbid":0,"product":{"id":55,"item_number":"P55","type":"PRODUCT","fixed":0,"price":1000,"tot_price":1000,"min_bid_value":1010,"currency":"EUR","raise_bid":10,"stamp_end":"2013-06-14 12:00:00","bids_number":12,"estimated_value":200,"extended_time":0,"url":"https:\/\/www.charitystars.com\/product\/juve-chelsea-3-0-champions-league-jersey-autographed-by-giorgio-chiellini","conversion_value":1,"eid":0,"user_has_bidded":false},"bid":{"id":323,"uid":126,"first_name":"Fabio","last_name":"Gastaldi","company_name":"","is_company":0,"title":"fab1","nationality":"IT","amount":1000,"max_amount":0,"table":"","stamp":1371166006,"real_stamp":"2013-06-14 01:26:46"}};
var p_currency = '€';
var conversion_value = '1';
var merch_items = [];
var gallery_items = [];

var inside_gala = false;

и сохраните каждую переменную в кавычках (т. е. «id», «item_number», «type», ...) в переменной с тем же именем.
На данный момент мне удалось запустить следующее

Код: Выделить всё

import requests
from bs4 import BeautifulSoup
from urllib import urlopen
import re
import json
import time
import csv
from bs4 import BeautifulSoup as soup
from pandas import DataFrame

import urllib2
hdr = {"User-Agent": "My Agent"}

req = urllib2.Request(http://www.charitystars.com/product/juve-chelsea-3-0-champions-league-jersey-autographed-by-giorgio-chiellini)
response = urllib2.urlopen(req)

htmlSource = response.read()
soup = BeautifulSoup(htmlSource)

title = soup.find_all("span", {"itemprop": "name"}) # get the title

script_soup = soup.find_all("script")
По какой-то причине script_soup содержит много информации, которая мне не нужна. Я считаю, что та часть, которая мне нужна, находится в script_soup[9], но я не знаю, как получить к ней доступ (эффективным способом). Буду очень признателен за помощь.

Подробнее здесь: https://stackoverflow.com/questions/679 ... and-urllib

Вернуться в «Python»