python
import requests
from bs4 import BeautifulSoup
import time
def fetch_data(url):
try:
response = requests.get(url)
if response.status_code == 200:
soup = BeautifulSoup(response.text, 'lxml')
示例:提取所有标题
titles = [title.text for title in soup.find_all('h1')]
return titles
else:
print(fFailed to fetch data from {url}, status code: {response.status_code})
return []
except Exception as e:
print(fError fetching data: {e})
return []
def save_data(data, filename='output.txt'):
with open(filename, 'a', encoding='utf8') as f:
for item in data:
f.write(item + '\n')
def crawl_and_update(url, interval=60):
while True:
print(Fetching data...)
data = fetch_data(url)
if data:
save_data(data)
print(fSleeping for {interval} seconds...)
time.sleep(interval)