[yt-dlp.git] / youtube_dl / extractor / francetv.py

# encoding: utf-8
import re
import json

from .common import InfoExtractor
from ..utils import (
    compat_urlparse,
)


class FranceTVBaseInfoExtractor(InfoExtractor):
    def _extract_video(self, video_id):
        info = self._download_xml(
            'http://www.francetvinfo.fr/appftv/webservices/video/'
            'getInfosOeuvre.php?id-diffusion='
            + video_id, video_id, 'Downloading XML config')

        manifest_url = info.find('videos/video/url').text
        video_url = manifest_url.replace('manifest.f4m', 'index_2_av.m3u8')
        video_url = video_url.replace('/z/', '/i/')
        thumbnail_path = info.find('image').text

        return {'id': video_id,
                'ext': 'flv' if video_url.startswith('rtmp') else 'mp4',
                'url': video_url,
                'title': info.find('titre').text,
                'thumbnail': compat_urlparse.urljoin('http://pluzz.francetv.fr', thumbnail_path),
                'description': info.find('synopsis').text,
                }


class PluzzIE(FranceTVBaseInfoExtractor):
    IE_NAME = u'pluzz.francetv.fr'
    _VALID_URL = r'https?://pluzz\.francetv\.fr/videos/(.*?)\.html'

    # Can't use tests, videos expire in 7 days

    def _real_extract(self, url):
        title = re.match(self._VALID_URL, url).group(1)
        webpage = self._download_webpage(url, title)
        video_id = self._search_regex(
            r'data-diffusion="(\d+)"', webpage, 'ID')
        return self._extract_video(video_id)


class FranceTvInfoIE(FranceTVBaseInfoExtractor):
    IE_NAME = u'francetvinfo.fr'
    _VALID_URL = r'https?://www\.francetvinfo\.fr/replay.*/(?P<title>.+)\.html'

    _TEST = {
        u'url': u'http://www.francetvinfo.fr/replay-jt/france-3/soir-3/jt-grand-soir-3-lundi-26-aout-2013_393427.html',
        u'file': u'84981923.mp4',
        u'info_dict': {
            u'title': u'Soir 3',
        },
        u'params': {
            u'skip_download': True,
        },
    }

    def _real_extract(self, url):
        mobj = re.match(self._VALID_URL, url)
        page_title = mobj.group('title')
        webpage = self._download_webpage(url, page_title)
        video_id = self._search_regex(r'id-video=(\d+?)"', webpage, u'video id')
        return self._extract_video(video_id)


class FranceTVIE(FranceTVBaseInfoExtractor):
    IE_NAME = u'francetv'
    IE_DESC = u'France 2, 3, 4, 5 and Ô'
    _VALID_URL = r'''(?x)https?://www\.france[2345o]\.fr/
        (?:
            emissions/.*?/(videos|emissions)/(?P<id>[^/?]+)
        |   (emission|jt)/(?P<key>[^/?]+)
        )'''

    _TESTS = [
        # france2
        {
            u'url': u'http://www.france2.fr/emissions/13h15-le-samedi-le-dimanche/videos/75540104',
            u'file': u'75540104.mp4',
            u'info_dict': {
                u'title': u'13h15, le samedi...',
                u'description': u'md5:2e5b58ba7a2d3692b35c792be081a03d',
            },
            u'params': {
                # m3u8 download
                u'skip_download': True,
            },
        },
        # france3
        {
            u'url': u'http://www.france3.fr/emissions/pieces-a-conviction/videos/rhozet_pac_ba_20131204_1933_03122013164521_F3',
            u'info_dict': {
                u'id': u'rhozet_pac_ba_20131204_1933_03122013164521_F3',
                u'ext': u'flv',
                u'title': u'Pièces à conviction du 04/12/2013',
                u'description': u'md5:1cf14ea302ba5f10d992c9eb2bff30dd',
            },
            u'params': {
                # rtmp download
                u'skip_download': True,
            },
        },
        # france4
        {
            u'url': u'http://www.france4.fr/emissions/hero-corp/videos/rhozet_herocorp_bonus_1_20131106_1923_06112013172108_F4',
            u'info_dict': {
                u'id': u'rhozet_herocorp_bonus_1_20131106_1923_06112013172108_F4',
                u'ext': u'flv',
                u'title': u'Hero Corp Making of - Extrait 1',
                u'description': u'md5:c87d54871b1790679aec1197e73d650a',
            },
            u'params': {
                # rtmp download
                u'skip_download': True,
            },
        },
        # france5
        {
            u'url': u'http://www.france5.fr/emissions/c-a-dire/videos/92837968',
            u'info_dict': {
                u'id': u'92837968',
                u'ext': u'mp4',
                u'title': u'C à dire ?!',
                u'description': u'md5:fb1db1cbad784dcce7c7a7bd177c8e2f',
            },
            u'params': {
                # m3u8 download
                u'skip_download': True,
            },
        },
        # franceo
        {
            u'url': u'http://www.franceo.fr/jt/info-afrique/04-12-2013',
            u'info_dict': {
                u'id': u'92327925',
                u'ext': u'mp4',
                u'title': u'Infô-Afrique',
                u'description': u'md5:ebf346da789428841bee0fd2a935ea55',
            },
            u'params': {
                # m3u8 download
                u'skip_download': True,
            },
            u'skip': u'The id changes frequently',
        },
    ]

    def _real_extract(self, url):
        mobj = re.match(self._VALID_URL, url)
        if mobj.group('key'):
            webpage = self._download_webpage(url, mobj.group('key'))
            id_res = [
                (r'''(?x)<div\s+class="video-player">\s*
                    <a\s+href="http://videos.francetv.fr/video/([0-9]+)"\s+
                    class="francetv-video-player">'''),
                (r'<a id="player_direct" href="http://info\.francetelevisions'
                 '\.fr/\?id-video=([^"/&]+)'),
            ]
            video_id = self._html_search_regex(id_res, webpage, u'video ID')
        else:
            video_id = mobj.group('id')
        return self._extract_video(video_id)


class GenerationQuoiIE(InfoExtractor):
    IE_NAME = u'france2.fr:generation-quoi'
    _VALID_URL = r'https?://generation-quoi\.france2\.fr/portrait/(?P<name>.*)(\?|$)'

    _TEST = {
        u'url': u'http://generation-quoi.france2.fr/portrait/garde-a-vous',
        u'file': u'k7FJX8VBcvvLmX4wA5Q.mp4',
        u'info_dict': {
            u'title': u'Génération Quoi - Garde à Vous',
            u'uploader': u'Génération Quoi',
        },
        u'params': {
            # It uses Dailymotion
            u'skip_download': True,
        },
    }

    def _real_extract(self, url):
        mobj = re.match(self._VALID_URL, url)
        name = mobj.group('name')
        info_url = compat_urlparse.urljoin(url, '/medias/video/%s.json' % name)
        info_json = self._download_webpage(info_url, name)
        info = json.loads(info_json)
        return self.url_result('http://www.dailymotion.com/video/%s' % info['id'],
            ie='Dailymotion')
Commit	Line	Data
5d8afe69 PR	1	# encoding: utf-8
5d8afe69 PR	2	import re
5b333c1c	3	import json
5d8afe69 PR	4
	5	from .common import InfoExtractor
	6	from ..utils import (
	7	compat_urlparse,
	8	)
	9
	10
648d25d4 JMF	11	class FranceTVBaseInfoExtractor(InfoExtractor):
648d25d4 JMF	12	def _extract_video(self, video_id):
e26f8712	13	info = self._download_xml(
648d25d4 JMF	14	'http://www.francetvinfo.fr/appftv/webservices/video/'
	15	'getInfosOeuvre.php?id-diffusion='
	16	+ video_id, video_id, 'Downloading XML config')
648d25d4 JMF	17
	18	manifest_url = info.find('videos/video/url').text
	19	video_url = manifest_url.replace('manifest.f4m', 'index_2_av.m3u8')
	20	video_url = video_url.replace('/z/', '/i/')
	21	thumbnail_path = info.find('image').text
	22
	23	return {'id': video_id,
9e606020	24	'ext': 'flv' if video_url.startswith('rtmp') else 'mp4',
648d25d4 JMF	25	'url': video_url,
	26	'title': info.find('titre').text,
	27	'thumbnail': compat_urlparse.urljoin('http://pluzz.francetv.fr', thumbnail_path),
	28	'description': info.find('synopsis').text,
	29	}
	30
	31
	32	class PluzzIE(FranceTVBaseInfoExtractor):
5d8afe69 PR	33	IE_NAME = u'pluzz.francetv.fr'
	34	_VALID_URL = r'https?://pluzz\.francetv\.fr/videos/(.*?)\.html'
	35
5d13df79	36	# Can't use tests, videos expire in 7 days
5d8afe69 PR	37
	38	def _real_extract(self, url):
	39	title = re.match(self._VALID_URL, url).group(1)
	40	webpage = self._download_webpage(url, title)
	41	video_id = self._search_regex(
	42	r'data-diffusion="(\d+)"', webpage, 'ID')
648d25d4	43	return self._extract_video(video_id)
5d8afe69	44
5d8afe69	45
648d25d4 JMF	46	class FranceTvInfoIE(FranceTVBaseInfoExtractor):
648d25d4 JMF	47	IE_NAME = u'francetvinfo.fr'
c0ade33e	48	_VALID_URL = r'https?://www\.francetvinfo\.fr/replay.*/(?P<title>.+)\.html'
5d8afe69	49
648d25d4 JMF	50	_TEST = {
	51	u'url': u'http://www.francetvinfo.fr/replay-jt/france-3/soir-3/jt-grand-soir-3-lundi-26-aout-2013_393427.html',
	52	u'file': u'84981923.mp4',
	53	u'info_dict': {
	54	u'title': u'Soir 3',
	55	},
	56	u'params': {
	57	u'skip_download': True,
	58	},
	59	}
	60
	61	def _real_extract(self, url):
	62	mobj = re.match(self._VALID_URL, url)
	63	page_title = mobj.group('title')
	64	webpage = self._download_webpage(url, page_title)
	65	video_id = self._search_regex(r'id-video=(\d+?)"', webpage, u'video id')
	66	return self._extract_video(video_id)
a825f330 JMF	67
a825f330 JMF	68
9e606020 JMF	69	class FranceTVIE(FranceTVBaseInfoExtractor):
	70	IE_NAME = u'francetv'
	71	IE_DESC = u'France 2, 3, 4, 5 and Ô'
	72	_VALID_URL = r'''(?x)https?://www\.france[2345o]\.fr/
da0a5d2d	73	(?:
9e606020 JMF	74	emissions/.*?/(videos\|emissions)/(?P<id>[^/?]+)
9e606020 JMF	75	\| (emission\|jt)/(?P<key>[^/?]+)
da0a5d2d	76	)'''
a825f330	77
9e606020 JMF	78	_TESTS = [
	79	# france2
	80	{
	81	u'url': u'http://www.france2.fr/emissions/13h15-le-samedi-le-dimanche/videos/75540104',
	82	u'file': u'75540104.mp4',
	83	u'info_dict': {
	84	u'title': u'13h15, le samedi...',
	85	u'description': u'md5:2e5b58ba7a2d3692b35c792be081a03d',
	86	},
	87	u'params': {
	88	# m3u8 download
	89	u'skip_download': True,
	90	},
a825f330	91	},
9e606020 JMF	92	# france3
	93	{
	94	u'url': u'http://www.france3.fr/emissions/pieces-a-conviction/videos/rhozet_pac_ba_20131204_1933_03122013164521_F3',
	95	u'info_dict': {
	96	u'id': u'rhozet_pac_ba_20131204_1933_03122013164521_F3',
	97	u'ext': u'flv',
	98	u'title': u'Pièces à conviction du 04/12/2013',
	99	u'description': u'md5:1cf14ea302ba5f10d992c9eb2bff30dd',
	100	},
	101	u'params': {
	102	# rtmp download
	103	u'skip_download': True,
	104	},
a825f330	105	},
9e606020 JMF	106	# france4
	107	{
	108	u'url': u'http://www.france4.fr/emissions/hero-corp/videos/rhozet_herocorp_bonus_1_20131106_1923_06112013172108_F4',
	109	u'info_dict': {
	110	u'id': u'rhozet_herocorp_bonus_1_20131106_1923_06112013172108_F4',
	111	u'ext': u'flv',
	112	u'title': u'Hero Corp Making of - Extrait 1',
	113	u'description': u'md5:c87d54871b1790679aec1197e73d650a',
	114	},
	115	u'params': {
	116	# rtmp download
	117	u'skip_download': True,
	118	},
	119	},
	120	# france5
	121	{
	122	u'url': u'http://www.france5.fr/emissions/c-a-dire/videos/92837968',
	123	u'info_dict': {
	124	u'id': u'92837968',
	125	u'ext': u'mp4',
	126	u'title': u'C à dire ?!',
	127	u'description': u'md5:fb1db1cbad784dcce7c7a7bd177c8e2f',
	128	},
	129	u'params': {
	130	# m3u8 download
	131	u'skip_download': True,
	132	},
	133	},
	134	# franceo
	135	{
	136	u'url': u'http://www.franceo.fr/jt/info-afrique/04-12-2013',
	137	u'info_dict': {
	138	u'id': u'92327925',
	139	u'ext': u'mp4',
	140	u'title': u'Infô-Afrique',
	141	u'description': u'md5:ebf346da789428841bee0fd2a935ea55',
	142	},
	143	u'params': {
	144	# m3u8 download
	145	u'skip_download': True,
	146	},
	147	u'skip': u'The id changes frequently',
	148	},
	149	]
a825f330 JMF	150
	151	def _real_extract(self, url):
	152	mobj = re.match(self._VALID_URL, url)
da0a5d2d PH	153	if mobj.group('key'):
da0a5d2d PH	154	webpage = self._download_webpage(url, mobj.group('key'))
9e606020 JMF	155	id_res = [
9e606020 JMF	156	(r'''(?x)<div\s+class="video-player">\s*
da0a5d2d	157	<a\s+href="http://videos.francetv.fr/video/([0-9]+)"\s+
9e606020 JMF	158	class="francetv-video-player">'''),
	159	(r'<a id="player_direct" href="http://info\.francetelevisions'
	160	'\.fr/\?id-video=([^"/&]+)'),
	161	]
	162	video_id = self._html_search_regex(id_res, webpage, u'video ID')
da0a5d2d PH	163	else:
da0a5d2d PH	164	video_id = mobj.group('id')
a825f330	165	return self._extract_video(video_id)
5b333c1c JMF	166
	167
	168	class GenerationQuoiIE(InfoExtractor):
9e0f897f	169	IE_NAME = u'france2.fr:generation-quoi'
5b333c1c JMF	170	_VALID_URL = r'https?://generation-quoi\.france2\.fr/portrait/(?P<name>.*)(\?\|$)'
	171
	172	_TEST = {
	173	u'url': u'http://generation-quoi.france2.fr/portrait/garde-a-vous',
	174	u'file': u'k7FJX8VBcvvLmX4wA5Q.mp4',
	175	u'info_dict': {
	176	u'title': u'Génération Quoi - Garde à Vous',
	177	u'uploader': u'Génération Quoi',
	178	},
	179	u'params': {
	180	# It uses Dailymotion
	181	u'skip_download': True,
	182	},
	183	}
	184
	185	def _real_extract(self, url):
	186	mobj = re.match(self._VALID_URL, url)
	187	name = mobj.group('name')
	188	info_url = compat_urlparse.urljoin(url, '/medias/video/%s.json' % name)
	189	info_json = self._download_webpage(info_url, name)
	190	info = json.loads(info_json)
	191	return self.url_result('http://www.dailymotion.com/video/%s' % info['id'],
	192	ie='Dailymotion')