[yt-dlp.git] / youtube_dl / extractor / youporn.py

from __future__ import unicode_literals

import re

from .common import InfoExtractor
from ..compat import compat_str
from ..utils import (
    int_or_none,
    sanitized_Request,
    str_to_int,
    unescapeHTML,
    unified_strdate,
)
from ..aes import aes_decrypt_text


class YouPornIE(InfoExtractor):
    _VALID_URL = r'https?://(?:www\.)?youporn\.com/watch/(?P<id>\d+)/(?P<display_id>[^/?#&]+)'
    _TESTS = [{
        'url': 'http://www.youporn.com/watch/505835/sex-ed-is-it-safe-to-masturbate-daily/',
        'md5': '3744d24c50438cf5b6f6d59feb5055c2',
        'info_dict': {
            'id': '505835',
            'display_id': 'sex-ed-is-it-safe-to-masturbate-daily',
            'ext': 'mp4',
            'title': 'Sex Ed: Is It Safe To Masturbate Daily?',
            'description': 'Love & Sex Answers: http://bit.ly/DanAndJenn -- Is It Unhealthy To Masturbate Daily?',
            'thumbnail': r're:^https?://.*\.jpg$',
            'uploader': 'Ask Dan And Jennifer',
            'upload_date': '20101217',
            'average_rating': int,
            'view_count': int,
            'comment_count': int,
            'categories': list,
            'tags': list,
            'age_limit': 18,
        },
    }, {
        # Unknown uploader
        'url': 'http://www.youporn.com/watch/561726/big-tits-awesome-brunette-on-amazing-webcam-show/?from=related3&al=2&from_id=561726&pos=4',
        'info_dict': {
            'id': '561726',
            'display_id': 'big-tits-awesome-brunette-on-amazing-webcam-show',
            'ext': 'mp4',
            'title': 'Big Tits Awesome Brunette On amazing webcam show',
            'description': 'http://sweetlivegirls.com Big Tits Awesome Brunette On amazing webcam show.mp4',
            'thumbnail': r're:^https?://.*\.jpg$',
            'uploader': 'Unknown',
            'upload_date': '20110418',
            'average_rating': int,
            'view_count': int,
            'comment_count': int,
            'categories': list,
            'tags': list,
            'age_limit': 18,
        },
        'params': {
            'skip_download': True,
        },
    }]

    def _real_extract(self, url):
        mobj = re.match(self._VALID_URL, url)
        video_id = mobj.group('id')
        display_id = mobj.group('display_id')

        request = sanitized_Request(url)
        request.add_header('Cookie', 'age_verified=1')
        webpage = self._download_webpage(request, display_id)

        title = self._search_regex(
            [r'(?:video_titles|videoTitle)\s*[:=]\s*(["\'])(?P<title>(?:(?!\1).)+)\1',
             r'<h1[^>]+class=["\']heading\d?["\'][^>]*>(?P<title>[^<]+)<'],
            webpage, 'title', group='title',
            default=None) or self._og_search_title(
            webpage, default=None) or self._html_search_meta(
            'title', webpage, fatal=True)

        links = []

        # Main source
        definitions = self._parse_json(
            self._search_regex(
                r'mediaDefinition\s*=\s*(\[.+?\]);', webpage,
                'media definitions', default='[]'),
            video_id, fatal=False)
        if definitions:
            for definition in definitions:
                if not isinstance(definition, dict):
                    continue
                video_url = definition.get('videoUrl')
                if isinstance(video_url, compat_str) and video_url:
                    links.append(video_url)

        # Fallback #1, this also contains extra low quality 180p format
        for _, link in re.findall(r'<a[^>]+href=(["\'])(http.+?)\1[^>]+title=["\']Download [Vv]ideo', webpage):
            links.append(link)

        # Fallback #2 (unavailable as at 22.06.2017)
        sources = self._search_regex(
            r'(?s)sources\s*:\s*({.+?})', webpage, 'sources', default=None)
        if sources:
            for _, link in re.findall(r'[^:]+\s*:\s*(["\'])(http.+?)\1', sources):
                links.append(link)

        # Fallback #3 (unavailable as at 22.06.2017)
        for _, link in re.findall(
                r'(?:videoSrc|videoIpadUrl|html5PlayerSrc)\s*[:=]\s*(["\'])(http.+?)\1', webpage):
            links.append(link)

        # Fallback #4, encrypted links (unavailable as at 22.06.2017)
        for _, encrypted_link in re.findall(
                r'encryptedQuality\d{3,4}URL\s*=\s*(["\'])([\da-zA-Z+/=]+)\1', webpage):
            links.append(aes_decrypt_text(encrypted_link, title, 32).decode('utf-8'))

        formats = []
        for video_url in set(unescapeHTML(link) for link in links):
            f = {
                'url': video_url,
            }
            # Video URL's path looks like this:
            #  /201012/17/505835/720p_1500k_505835/YouPorn%20-%20Sex%20Ed%20Is%20It%20Safe%20To%20Masturbate%20Daily.mp4
            #  /201012/17/505835/vl_240p_240k_505835/YouPorn%20-%20Sex%20Ed%20Is%20It%20Safe%20To%20Masturbate%20Daily.mp4
            # We will benefit from it by extracting some metadata
            mobj = re.search(r'(?P<height>\d{3,4})[pP]_(?P<bitrate>\d+)[kK]_\d+/', video_url)
            if mobj:
                height = int(mobj.group('height'))
                bitrate = int(mobj.group('bitrate'))
                f.update({
                    'format_id': '%dp-%dk' % (height, bitrate),
                    'height': height,
                    'tbr': bitrate,
                })
            formats.append(f)
        self._sort_formats(formats)

        description = self._og_search_description(webpage, default=None)
        thumbnail = self._search_regex(
            r'(?:imageurl\s*=|poster\s*:)\s*(["\'])(?P<thumbnail>.+?)\1',
            webpage, 'thumbnail', fatal=False, group='thumbnail')

        uploader = self._html_search_regex(
            r'(?s)<div[^>]+class=["\']submitByLink["\'][^>]*>(.+?)</div>',
            webpage, 'uploader', fatal=False)
        upload_date = unified_strdate(self._html_search_regex(
            [r'Date\s+[Aa]dded:\s*<span>([^<]+)',
             r'(?s)<div[^>]+class=["\']videoInfo(?:Date|Time)["\'][^>]*>(.+?)</div>'],
            webpage, 'upload date', fatal=False))

        age_limit = self._rta_search(webpage)

        average_rating = int_or_none(self._search_regex(
            r'<div[^>]+class=["\']videoRatingPercentage["\'][^>]*>(\d+)%</div>',
            webpage, 'average rating', fatal=False))

        view_count = str_to_int(self._search_regex(
            r'(?s)<div[^>]+class=(["\']).*?\bvideoInfoViews\b.*?\1[^>]*>.*?(?P<count>[\d,.]+)<',
            webpage, 'view count', fatal=False, group='count'))
        comment_count = str_to_int(self._search_regex(
            r'>All [Cc]omments? \(([\d,.]+)\)',
            webpage, 'comment count', fatal=False))

        def extract_tag_box(regex, title):
            tag_box = self._search_regex(regex, webpage, title, default=None)
            if not tag_box:
                return []
            return re.findall(r'<a[^>]+href=[^>]+>([^<]+)', tag_box)

        categories = extract_tag_box(
            r'(?s)Categories:.*?</[^>]+>(.+?)</div>', 'categories')
        tags = extract_tag_box(
            r'(?s)Tags:.*?</div>\s*<div[^>]+class=["\']tagBoxContent["\'][^>]*>(.+?)</div>',
            'tags')

        return {
            'id': video_id,
            'display_id': display_id,
            'title': title,
            'description': description,
            'thumbnail': thumbnail,
            'uploader': uploader,
            'upload_date': upload_date,
            'average_rating': average_rating,
            'view_count': view_count,
            'comment_count': comment_count,
            'categories': categories,
            'tags': tags,
            'age_limit': age_limit,
            'formats': formats,
        }
Commit	Line	Data
f24e9833 PH	1	from __future__ import unicode_literals
f24e9833 PH	2
0143dc02	3	import re
0143dc02 PH	4
0143dc02 PH	5	from .common import InfoExtractor
d4893e76	6	from ..compat import compat_str
1cc79574	7	from ..utils import (
589c33da	8	int_or_none,
5c2266df	9	sanitized_Request,
589c33da	10	str_to_int,
0143dc02 PH	11	unescapeHTML,
	12	unified_strdate,
	13	)
589c33da	14	from ..aes import aes_decrypt_text
0143dc02	15
bfe9de85	16
0143dc02	17	class YouPornIE(InfoExtractor):
589c33da	18	_VALID_URL = r'https?://(?:www\.)?youporn\.com/watch/(?P<id>\d+)/(?P<display_id>[^/?#&]+)'
4f13f8f7	19	_TESTS = [{
f24e9833	20	'url': 'http://www.youporn.com/watch/505835/sex-ed-is-it-safe-to-masturbate-daily/',
2c3322e3	21	'md5': '3744d24c50438cf5b6f6d59feb5055c2',
f24e9833 PH	22	'info_dict': {
f24e9833 PH	23	'id': '505835',
589c33da	24	'display_id': 'sex-ed-is-it-safe-to-masturbate-daily',
f24e9833	25	'ext': 'mp4',
f24e9833	26	'title': 'Sex Ed: Is It Safe To Masturbate Daily?',
589c33da	27	'description': 'Love & Sex Answers: http://bit.ly/DanAndJenn -- Is It Unhealthy To Masturbate Daily?',
ec85ded8	28	'thumbnail': r're:^https?://.*\.jpg$',
e572a101	29	'uploader': 'Ask Dan And Jennifer',
18166bb8	30	'upload_date': '20101217',
589c33da S	31	'average_rating': int,
589c33da S	32	'view_count': int,
755ff8d2	33	'comment_count': int,
589c33da S	34	'categories': list,
589c33da S	35	'tags': list,
f24e9833	36	'age_limit': 18,
4f13f8f7 S	37	},
4f13f8f7 S	38	}, {
f6af0f88	39	# Unknown uploader
4f13f8f7 S	40	'url': 'http://www.youporn.com/watch/561726/big-tits-awesome-brunette-on-amazing-webcam-show/?from=related3&al=2&from_id=561726&pos=4',
	41	'info_dict': {
	42	'id': '561726',
	43	'display_id': 'big-tits-awesome-brunette-on-amazing-webcam-show',
	44	'ext': 'mp4',
	45	'title': 'Big Tits Awesome Brunette On amazing webcam show',
	46	'description': 'http://sweetlivegirls.com Big Tits Awesome Brunette On amazing webcam show.mp4',
ec85ded8	47	'thumbnail': r're:^https?://.*\.jpg$',
f6af0f88	48	'uploader': 'Unknown',
18166bb8	49	'upload_date': '20110418',
4f13f8f7 S	50	'average_rating': int,
4f13f8f7 S	51	'view_count': int,
755ff8d2	52	'comment_count': int,
4f13f8f7 S	53	'categories': list,
	54	'tags': list,
	55	'age_limit': 18,
	56	},
	57	'params': {
	58	'skip_download': True,
	59	},
	60	}]
0143dc02	61
0143dc02 PH	62	def _real_extract(self, url):
0143dc02 PH	63	mobj = re.match(self._VALID_URL, url)
589c33da S	64	video_id = mobj.group('id')
589c33da S	65	display_id = mobj.group('display_id')
0143dc02	66
5c2266df	67	request = sanitized_Request(url)
589c33da S	68	request.add_header('Cookie', 'age_verified=1')
	69	webpage = self._download_webpage(request, display_id)
	70
	71	title = self._search_regex(
d4893e76	72	[r'(?:video_titles\|videoTitle)\s[:=]\s(["\'])(?P<title>(?:(?!\1).)+)\1',
97b6e301 S	73	r'<h1[^>]+class=["\']heading\d?["\'][^>]*>(?P<title>[^<]+)<'],
	74	webpage, 'title', group='title',
	75	default=None) or self._og_search_title(
	76	webpage, default=None) or self._html_search_meta(
	77	'title', webpage, fatal=True)
0143dc02	78
589c33da S	79	links = []
589c33da S	80
d4893e76 S	81	# Main source
	82	definitions = self._parse_json(
	83	self._search_regex(
	84	r'mediaDefinition\s=\s(\[.+?\]);', webpage,
	85	'media definitions', default='[]'),
	86	video_id, fatal=False)
	87	if definitions:
	88	for definition in definitions:
	89	if not isinstance(definition, dict):
	90	continue
	91	video_url = definition.get('videoUrl')
	92	if isinstance(video_url, compat_str) and video_url:
	93	links.append(video_url)
	94
	95	# Fallback #1, this also contains extra low quality 180p format
	96	for _, link in re.findall(r'<a[^>]+href=(["\'])(http.+?)\1[^>]+title=["\']Download [Vv]ideo', webpage):
	97	links.append(link)
	98
	99	# Fallback #2 (unavailable as at 22.06.2017)
589c33da	100	sources = self._search_regex(
002c7552	101	r'(?s)sources\s:\s({.+?})', webpage, 'sources', default=None)
589c33da S	102	if sources:
589c33da S	103	for _, link in re.findall(r'[^:]+\s:\s(["\'])(http.+?)\1', sources):
e572a101	104	links.append(link)
5f6a1245	105
d4893e76	106	# Fallback #3 (unavailable as at 22.06.2017)
589c33da	107	for _, link in re.findall(
d4893e76	108	r'(?:videoSrc\|videoIpadUrl\|html5PlayerSrc)\s[:=]\s(["\'])(http.+?)\1', webpage):
589c33da S	109	links.append(link)
589c33da S	110
d4893e76	111	# Fallback #4, encrypted links (unavailable as at 22.06.2017)
589c33da S	112	for _, encrypted_link in re.findall(
	113	r'encryptedQuality\d{3,4}URL\s=\s(["\'])([\da-zA-Z+/=]+)\1', webpage):
	114	links.append(aes_decrypt_text(encrypted_link, title, 32).decode('utf-8'))
	115
0143dc02	116	formats = []
589c33da S	117	for video_url in set(unescapeHTML(link) for link in links):
589c33da S	118	f = {
0143dc02	119	'url': video_url,
589c33da S	120	}
	121	# Video URL's path looks like this:
	122	# /201012/17/505835/720p_1500k_505835/YouPorn%20-%20Sex%20Ed%20Is%20It%20Safe%20To%20Masturbate%20Daily.mp4
d627cec6	123	# /201012/17/505835/vl_240p_240k_505835/YouPorn%20-%20Sex%20Ed%20Is%20It%20Safe%20To%20Masturbate%20Daily.mp4
589c33da	124	# We will benefit from it by extracting some metadata
d627cec6	125	mobj = re.search(r'(?P<height>\d{3,4})[pP]_(?P<bitrate>\d+)[kK]_\d+/', video_url)
589c33da S	126	if mobj:
	127	height = int(mobj.group('height'))
	128	bitrate = int(mobj.group('bitrate'))
	129	f.update({
	130	'format_id': '%dp-%dk' % (height, bitrate),
	131	'height': height,
	132	'tbr': bitrate,
	133	})
	134	formats.append(f)
bfe9de85 PH	135	self._sort_formats(formats)
bfe9de85 PH	136
b99d88c6	137	description = self._og_search_description(webpage, default=None)
589c33da S	138	thumbnail = self._search_regex(
	139	r'(?:imageurl\s=\|poster\s:)\s*(["\'])(?P<thumbnail>.+?)\1',
	140	webpage, 'thumbnail', fatal=False, group='thumbnail')
	141
4f13f8f7	142	uploader = self._html_search_regex(
2c3322e3	143	r'(?s)<div[^>]+class=["\']submitByLink["\'][^>]*>(.+?)</div>',
589c33da S	144	webpage, 'uploader', fatal=False)
589c33da S	145	upload_date = unified_strdate(self._html_search_regex(
18166bb8 S	146	[r'Date\s+[Aa]dded:\s*<span>([^<]+)',
18166bb8 S	147	r'(?s)<div[^>]+class=["\']videoInfo(?:Date\|Time)["\'][^>]*>(.+?)</div>'],
589c33da S	148	webpage, 'upload date', fatal=False))
	149
	150	age_limit = self._rta_search(webpage)
	151
	152	average_rating = int_or_none(self._search_regex(
2c3322e3	153	r'<div[^>]+class=["\']videoRatingPercentage["\'][^>]*>(\d+)%</div>',
589c33da S	154	webpage, 'average rating', fatal=False))
	155
	156	view_count = str_to_int(self._search_regex(
2c3322e3 S	157	r'(?s)<div[^>]+class=(["\']).?\bvideoInfoViews\b.?\1[^>]>.?(?P<count>[\d,.]+)<',
2c3322e3 S	158	webpage, 'view count', fatal=False, group='count'))
755ff8d2 S	159	comment_count = str_to_int(self._search_regex(
	160	r'>All [Cc]omments? \(([\d,.]+)\)',
	161	webpage, 'comment count', fatal=False))
589c33da	162
f6af0f88 S	163	def extract_tag_box(regex, title):
f6af0f88 S	164	tag_box = self._search_regex(regex, webpage, title, default=None)
589c33da S	165	if not tag_box:
	166	return []
	167	return re.findall(r'<a[^>]+href=[^>]+>([^<]+)', tag_box)
	168
f6af0f88 S	169	categories = extract_tag_box(
	170	r'(?s)Categories:.*?</[^>]+>(.+?)</div>', 'categories')
	171	tags = extract_tag_box(
	172	r'(?s)Tags:.?</div>\s<div[^>]+class=["\']tagBoxContent["\'][^>]*>(.+?)</div>',
	173	'tags')
5f6a1245	174
7df28654	175	return {
7df28654	176	'id': video_id,
589c33da S	177	'display_id': display_id,
	178	'title': title,
	179	'description': description,
	180	'thumbnail': thumbnail,
	181	'uploader': uploader,
	182	'upload_date': upload_date,
	183	'average_rating': average_rating,
	184	'view_count': view_count,
755ff8d2	185	'comment_count': comment_count,
589c33da S	186	'categories': categories,
589c33da S	187	'tags': tags,
7df28654	188	'age_limit': age_limit,
	189	'formats': formats,
	190	}