]> jfr.im git - yt-dlp.git/blame - youtube_dl/extractor/tvp.py
[tvp] Modernize
[yt-dlp.git] / youtube_dl / extractor / tvp.py
CommitLineData
29f400b9 1# -*- coding: utf-8 -*-
24144e3b 2from __future__ import unicode_literals
5137ebac 3
29f400b9
TF
4import re
5
5137ebac 6from .common import InfoExtractor
c3a3028f 7
5137ebac
MC
8
9class TvpIE(InfoExtractor):
24144e3b 10 IE_NAME = 'tvp.pl'
29f400b9
TF
11 _VALID_URL = r'https?://(?P<type>vod|www)\.tvp\.pl/.*/(?P<id>\d+)$'
12
13 _TESTS = [
14 {
15 'url': 'http://www.tvp.pl/warszawa/magazyny/campusnews/wideo/31102013/12878238',
16 'info_dict': {
17 'id': '12878238',
18 'ext': 'wmv',
19 'title': 'CAMPUSnews, 31.10.2013 - Odcinek 2',
20 'description': '',
21 },
22 'skip': 'Download has to use same server IP as extraction. Therefore, a good (load-balancing) DNS resolver will make the download fail.',
23 }, {
24 'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem/wideo/odc-2/4278035',
25 'info_dict': {
26 'id': '4278035',
27 'ext': 'wmv',
28 'title': 'Ogniem i mieczem, odc. 2',
29 'description': 'Bohun dowiaduje się o złamaniu przez kniahinię danego mu słowa i wyrusza do Rozłogów. Helenie w ostatniej chwili udaje się uciec dzięki pomocy Zagłoby.',
30 },
31 'skip': 'As above',
32 }, {
33 'url': 'http://vod.tvp.pl/seriale/obyczajowe/czas-honoru/sezon-1-1-13/i-seria-odc-13/194536',
34 'info_dict': {
35 'id': '194536',
36 'ext': 'mp4',
37 'title': 'Czas honoru, I seria – odc. 13',
38 'description': 'WŁADEK\nCzesław prosi Marię o dostarczenie Władkowi zarazki tyfusu. Jeśli zachoruje zostanie przewieziony do szpitala skąd łatwiej będzie go odbić. Czy matka zdecyduje się zarazić syna? Karol odwiedza Wandę przyznaje się, że ją oszukiwał, ale ostrzega też, że grozi jej aresztowanie i nalega, żeby wyjechała z Warszawy. Czy dziewczyna zdecyduje się znów oddalić od ukochanego? Rozpoczyna się akcja odbicia Władka.',
39 },
40 }, {
41 'url': 'http://www.tvp.pl/there-can-be-anything-so-i-shortened-it/17916176',
42 'info_dict': {
43 'id': '17916176',
44 'ext': 'mp4',
45 'title': 'rozmaitosci, TVP Gorzów pokaże filmy studentów z podroży dookoła świata',
46 'description': '',
47 },
48 'params': {
49 # m3u8 download
50 'skip_download': 'true',
51 },
52 }, {
53 'url': 'http://vod.tvp.pl/seriale/obyczajowe/na-sygnale/sezon-2-27-/odc-39/17834272',
54 'info_dict': {
55 'id': '17834272',
56 'ext': 'mp4',
57 'title': 'Na sygnale, odc. 39',
58 'description': 'Ekipa Wiktora ratuje młodą matkę, która spadła ze schodów trzymając na rękach noworodka. Okazuje się, że dziewczyna jest surogatką, a biologiczni rodzice dziecka próbują zmusić ją do oddania synka…',
59 },
60 'params': {
61 # m3u8 download
62 'skip_download': 'true',
63 },
5137ebac 64 },
29f400b9 65 ]
5137ebac
MC
66
67 def _real_extract(self, url):
29f400b9
TF
68 mobj = re.match(self._VALID_URL, url)
69 video_id = mobj.group('id')
70 webpage = self._download_webpage(
71 'http://www.tvp.pl/sess/tvplayer.php?object_id=%s' % video_id, video_id)
72 title = self._og_search_title(webpage)
73 series = self._search_regex(
74 r'{name:\s*([\'"])SeriesTitle\1,\s*value:\s*\1(?P<series>.*?)\1},',
75 webpage, 'series', group='series', default=None)
76 if series is not None and series not in title:
77 title = '%s, %s' % (series, title)
78 info_dict = {
5137ebac 79 'id': video_id,
29f400b9 80 'title': title,
c3a3028f 81 'thumbnail': self._og_search_thumbnail(webpage),
225e4b96 82 'description': self._og_search_description(webpage),
5137ebac 83 }
29f400b9
TF
84 video_url = self._search_regex(
85 r'0:{src:([\'"])(?P<url>.*?)\1', webpage, 'formats', group='url', default=None)
86 if video_url is None:
87 video_url = self._download_json(
88 'http://www.tvp.pl/pub/stat/videofileinfo?video_id=%s' % video_id,
89 video_id)['video_url']
90
91 ext = video_url.rsplit('.', 1)[-1]
92 if ext != 'ism/manifest':
93 if '/' in ext:
94 ext = 'mp4'
95 info_dict.update({
96 'ext': ext,
97 'url': video_url,
98 })
99 else:
100 m3u8_url = re.sub('([^/]*)\.ism/manifest', r'\1.ism/\1.m3u8', video_url)
101 formats = self._extract_m3u8_formats(m3u8_url, video_id, 'mp4')
102 info_dict.update({
103 'formats': formats,
104 })
105 return info_dict
6ce2c678
TF
106
107
108class TvpSeriesIE(InfoExtractor):
109 IE_NAME = 'tvp.pl:Series'
110 _VALID_URL = r'https?://vod\.tvp\.pl/(?:[^/]+/){2}(?P<id>[^/]+)/?$'
111
112 _TESTS = [
113 {
114 'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem',
115 'info_dict': {
116 'title': 'Ogniem i mieczem',
117 'id': '4278026',
118 },
119 'playlist_count': 4,
120 }, {
121 'url': 'http://vod.tvp.pl/audycje/podroze/boso-przez-swiat',
122 'info_dict': {
123 'title': 'Boso przez świat',
124 'id': '9329207',
125 },
126 'playlist_count': 86,
127 }
128 ]
129
6ce2c678
TF
130 def _real_extract(self, url):
131 display_id = self._match_id(url)
2415951e 132 webpage = self._download_webpage(url, display_id, tries=5)
6ce2c678 133 title = self._html_search_regex(
2415951e 134 r'(?s) id=[\'"]path[\'"]>(?:.*? / ){2}(.*?)</span>', webpage, 'series')
6ce2c678 135 playlist_id = self._search_regex(r'nodeId:\s*(\d+)', webpage, 'playlist id')
2415951e 136 playlist = self._download_webpage(
6ce2c678 137 'http://vod.tvp.pl/vod/seriesAjax?type=series&nodeId=%s&recommend'
2415951e 138 'edId=0&sort=&page=0&pageSize=10000' % playlist_id, display_id, tries=5)
6ce2c678
TF
139 videos_paths = re.findall(
140 '(?s)class="shortTitle">.*?href="(/[^"]+)', playlist)
141 entries = [
142 self.url_result('http://vod.tvp.pl%s' % v_path, ie=TvpIE.ie_key())
143 for v_path in videos_paths]
144 return {
145 '_type': 'playlist',
146 'id': playlist_id,
147 'display_id': display_id,
148 'title': title,
149 'entries': entries,
150 }