[yt-dlp.git] / yt_dlp / extractor / manyvids.py

import re

from .common import InfoExtractor
from ..utils import (
    determine_ext,
    extract_attributes,
    int_or_none,
    str_to_int,
    url_or_none,
    urlencode_postdata,
)


class ManyVidsIE(InfoExtractor):
    _WORKING = False
    _VALID_URL = r'(?i)https?://(?:www\.)?manyvids\.com/video/(?P<id>\d+)'
    _TESTS = [{
        # preview video
        'url': 'https://www.manyvids.com/Video/133957/everthing-about-me/',
        'md5': '03f11bb21c52dd12a05be21a5c7dcc97',
        'info_dict': {
            'id': '133957',
            'ext': 'mp4',
            'title': 'everthing about me (Preview)',
            'uploader': 'ellyxxix',
            'view_count': int,
            'like_count': int,
        },
    }, {
        # full video
        'url': 'https://www.manyvids.com/Video/935718/MY-FACE-REVEAL/',
        'md5': 'bb47bab0e0802c2a60c24ef079dfe60f',
        'info_dict': {
            'id': '935718',
            'ext': 'mp4',
            'title': 'MY FACE REVEAL',
            'description': 'md5:ec5901d41808b3746fed90face161612',
            'uploader': 'Sarah Calanthe',
            'view_count': int,
            'like_count': int,
        },
    }]

    def _real_extract(self, url):
        video_id = self._match_id(url)

        real_url = 'https://www.manyvids.com/video/%s/gtm.js' % (video_id, )
        try:
            webpage = self._download_webpage(real_url, video_id)
        except Exception:
            # probably useless fallback
            webpage = self._download_webpage(url, video_id)

        info = self._search_regex(
            r'''(<div\b[^>]*\bid\s*=\s*(['"])pageMetaDetails\2[^>]*>)''',
            webpage, 'meta details', default='')
        info = extract_attributes(info)

        player = self._search_regex(
            r'''(<div\b[^>]*\bid\s*=\s*(['"])rmpPlayerStream\2[^>]*>)''',
            webpage, 'player details', default='')
        player = extract_attributes(player)

        video_urls_and_ids = (
            (info.get('data-meta-video'), 'video'),
            (player.get('data-video-transcoded'), 'transcoded'),
            (player.get('data-video-filepath'), 'filepath'),
            (self._og_search_video_url(webpage, secure=False, default=None), 'og_video'),
        )

        def txt_or_none(s, default=None):
            return (s.strip() or default) if isinstance(s, str) else default

        uploader = txt_or_none(info.get('data-meta-author'))

        def mung_title(s):
            if uploader:
                s = re.sub(r'^\s*%s\s+[|-]' % (re.escape(uploader), ), '', s)
            return txt_or_none(s)

        title = (
            mung_title(info.get('data-meta-title'))
            or self._html_search_regex(
                (r'<span[^>]+class=["\']item-title[^>]+>([^<]+)',
                 r'<h2[^>]+class=["\']h2 m-0["\'][^>]*>([^<]+)'),
                webpage, 'title', default=None)
            or self._html_search_meta(
                'twitter:title', webpage, 'title', fatal=True))

        title = re.sub(r'\s*[|-]\s+ManyVids\s*$', '', title) or title

        if any(p in webpage for p in ('preview_videos', '_preview.mp4')):
            title += ' (Preview)'

        mv_token = self._search_regex(
            r'data-mvtoken=(["\'])(?P<value>(?:(?!\1).)+)\1', webpage,
            'mv token', default=None, group='value')

        if mv_token:
            # Sets some cookies
            self._download_webpage(
                'https://www.manyvids.com/includes/ajax_repository/you_had_me_at_hello.php',
                video_id, note='Setting format cookies', fatal=False,
                data=urlencode_postdata({
                    'mvtoken': mv_token,
                    'vid': video_id,
                }), headers={
                    'Referer': url,
                    'X-Requested-With': 'XMLHttpRequest'
                })

        formats = []
        for v_url, fmt in video_urls_and_ids:
            v_url = url_or_none(v_url)
            if not v_url:
                continue
            if determine_ext(v_url) == 'm3u8':
                formats.extend(self._extract_m3u8_formats(
                    v_url, video_id, 'mp4', entry_protocol='m3u8_native',
                    m3u8_id='hls'))
            else:
                formats.append({
                    'url': v_url,
                    'format_id': fmt,
                })

        self._remove_duplicate_formats(formats)

        for f in formats:
            if f.get('height') is None:
                f['height'] = int_or_none(
                    self._search_regex(r'_(\d{2,3}[02468])_', f['url'], 'video height', default=None))
            if '/preview/' in f['url']:
                f['format_id'] = '_'.join(filter(None, (f.get('format_id'), 'preview')))
                f['preference'] = -10
            if 'transcoded' in f['format_id']:
                f['preference'] = f.get('preference', -1) - 1

        def get_likes():
            likes = self._search_regex(
                r'''(<a\b[^>]*\bdata-id\s*=\s*(['"])%s\2[^>]*>)''' % (video_id, ),
                webpage, 'likes', default='')
            likes = extract_attributes(likes)
            return int_or_none(likes.get('data-likes'))

        def get_views():
            return str_to_int(self._html_search_regex(
                r'''(?s)<span\b[^>]*\bclass\s*=["']views-wrapper\b[^>]+>.+?<span\b[^>]+>\s*(\d[\d,.]*)\s*</span>''',
                webpage, 'view count', default=None))

        return {
            'id': video_id,
            'title': title,
            'formats': formats,
            'description': txt_or_none(info.get('data-meta-description')),
            'uploader': txt_or_none(info.get('data-meta-author')),
            'thumbnail': (
                url_or_none(info.get('data-meta-image'))
                or url_or_none(player.get('data-video-screenshot'))),
            'view_count': get_views(),
            'like_count': get_likes(),
        }
Commit	Line	Data
db4678e4	1	import re
db4678e4	2
e9b86526	3	from .common import InfoExtractor
38d15ba7 S	4	from ..utils import (
38d15ba7 S	5	determine_ext,
db4678e4	6	extract_attributes,
38d15ba7 S	7	int_or_none,
38d15ba7 S	8	str_to_int,
db4678e4	9	url_or_none,
38d15ba7 S	10	urlencode_postdata,
38d15ba7 S	11	)
e9b86526 J	12
	13
	14	class ManyVidsIE(InfoExtractor):
df773c3d	15	_WORKING = False
efc57145	16	_VALID_URL = r'(?i)https?://(?:www\.)?manyvids\.com/video/(?P<id>\d+)'
38d15ba7 S	17	_TESTS = [{
38d15ba7 S	18	# preview video
e9b86526 J	19	'url': 'https://www.manyvids.com/Video/133957/everthing-about-me/',
	20	'md5': '03f11bb21c52dd12a05be21a5c7dcc97',
	21	'info_dict': {
	22	'id': '133957',
	23	'ext': 'mp4',
efc57145	24	'title': 'everthing about me (Preview)',
db4678e4	25	'uploader': 'ellyxxix',
efc57145 S	26	'view_count': int,
	27	'like_count': int,
	28	},
38d15ba7 S	29	}, {
	30	# full video
	31	'url': 'https://www.manyvids.com/Video/935718/MY-FACE-REVEAL/',
db4678e4	32	'md5': 'bb47bab0e0802c2a60c24ef079dfe60f',
38d15ba7 S	33	'info_dict': {
	34	'id': '935718',
	35	'ext': 'mp4',
	36	'title': 'MY FACE REVEAL',
db4678e4	37	'description': 'md5:ec5901d41808b3746fed90face161612',
db4678e4	38	'uploader': 'Sarah Calanthe',
38d15ba7 S	39	'view_count': int,
	40	'like_count': int,
	41	},
	42	}]
e9b86526 J	43
e9b86526 J	44	def _real_extract(self, url):
e9b86526	45	video_id = self._match_id(url)
efc57145	46
db4678e4	47	real_url = 'https://www.manyvids.com/video/%s/gtm.js' % (video_id, )
	48	try:
	49	webpage = self._download_webpage(real_url, video_id)
	50	except Exception:
	51	# probably useless fallback
	52	webpage = self._download_webpage(url, video_id)
	53
	54	info = self._search_regex(
	55	r'''(<div\b[^>]\bid\s=\s(['"])pageMetaDetails\2[^>]>)''',
	56	webpage, 'meta details', default='')
	57	info = extract_attributes(info)
	58
	59	player = self._search_regex(
	60	r'''(<div\b[^>]\bid\s=\s(['"])rmpPlayerStream\2[^>]>)''',
	61	webpage, 'player details', default='')
	62	player = extract_attributes(player)
	63
	64	video_urls_and_ids = (
	65	(info.get('data-meta-video'), 'video'),
	66	(player.get('data-video-transcoded'), 'transcoded'),
	67	(player.get('data-video-filepath'), 'filepath'),
	68	(self._og_search_video_url(webpage, secure=False, default=None), 'og_video'),
	69	)
	70
	71	def txt_or_none(s, default=None):
46d09f87	72	return (s.strip() or default) if isinstance(s, str) else default
db4678e4	73
db4678e4	74	uploader = txt_or_none(info.get('data-meta-author'))
e9b86526	75
db4678e4	76	def mung_title(s):
	77	if uploader:
	78	s = re.sub(r'^\s*%s\s+[\|-]' % (re.escape(uploader), ), '', s)
	79	return txt_or_none(s)
efc57145	80
db4678e4	81	title = (
	82	mung_title(info.get('data-meta-title'))
	83	or self._html_search_regex(
	84	(r'<span[^>]+class=["\']item-title[^>]+>([^<]+)',
	85	r'<h2[^>]+class=["\']h2 m-0["\'][^>]*>([^<]+)'),
	86	webpage, 'title', default=None)
	87	or self._html_search_meta(
	88	'twitter:title', webpage, 'title', fatal=True))
	89
	90	title = re.sub(r'\s[\|-]\s+ManyVids\s$', '', title) or title
38d15ba7 S	91
	92	if any(p in webpage for p in ('preview_videos', '_preview.mp4')):
	93	title += ' (Preview)'
	94
	95	mv_token = self._search_regex(
	96	r'data-mvtoken=(["\'])(?P<value>(?:(?!\1).)+)\1', webpage,
	97	'mv token', default=None, group='value')
	98
	99	if mv_token:
	100	# Sets some cookies
	101	self._download_webpage(
	102	'https://www.manyvids.com/includes/ajax_repository/you_had_me_at_hello.php',
db4678e4	103	video_id, note='Setting format cookies', fatal=False,
db4678e4	104	data=urlencode_postdata({
38d15ba7 S	105	'mvtoken': mv_token,
	106	'vid': video_id,
	107	}), headers={
	108	'Referer': url,
	109	'X-Requested-With': 'XMLHttpRequest'
	110	})
	111
db4678e4	112	formats = []
	113	for v_url, fmt in video_urls_and_ids:
	114	v_url = url_or_none(v_url)
	115	if not v_url:
	116	continue
	117	if determine_ext(v_url) == 'm3u8':
	118	formats.extend(self._extract_m3u8_formats(
	119	v_url, video_id, 'mp4', entry_protocol='m3u8_native',
	120	m3u8_id='hls'))
	121	else:
	122	formats.append({
	123	'url': v_url,
	124	'format_id': fmt,
	125	})
	126
	127	self._remove_duplicate_formats(formats)
	128
	129	for f in formats:
	130	if f.get('height') is None:
	131	f['height'] = int_or_none(
	132	self._search_regex(r'_(\d{2,3}[02468])_', f['url'], 'video height', default=None))
	133	if '/preview/' in f['url']:
	134	f['format_id'] = '_'.join(filter(None, (f.get('format_id'), 'preview')))
	135	f['preference'] = -10
	136	if 'transcoded' in f['format_id']:
	137	f['preference'] = f.get('preference', -1) - 1
	138
db4678e4	139	def get_likes():
	140	likes = self._search_regex(
	141	r'''(<a\b[^>]\bdata-id\s=\s(['"])%s\2[^>]>)''' % (video_id, ),
	142	webpage, 'likes', default='')
	143	likes = extract_attributes(likes)
	144	return int_or_none(likes.get('data-likes'))
efc57145	145
db4678e4	146	def get_views():
	147	return str_to_int(self._html_search_regex(
	148	r'''(?s)<span\b[^>]\bclass\s=["']views-wrapper\b[^>]+>.+?<span\b[^>]+>\s(\d[\d,.])\s*</span>''',
	149	webpage, 'view count', default=None))
efc57145	150
e9b86526 J	151	return {
	152	'id': video_id,
	153	'title': title,
38d15ba7	154	'formats': formats,
db4678e4	155	'description': txt_or_none(info.get('data-meta-description')),
	156	'uploader': txt_or_none(info.get('data-meta-author')),
	157	'thumbnail': (
	158	url_or_none(info.get('data-meta-image'))
	159	or url_or_none(player.get('data-video-screenshot'))),
	160	'view_count': get_views(),
	161	'like_count': get_likes(),
e9b86526	162	}