#617498 xserver-xorg-video-radeon: Driver crash when watching Youtube video

Package:
xserver-xorg-video-radeon
Source:
xserver-xorg-video-ati
Description:
X.Org X server -- AMD/ATI Radeon display driver
Submitter:
Kjetil Kjernsmo
Date:
2011-10-06 07:24:03 UTC
Severity:
important
#617498#5
Date:
2011-03-09 12:31:44 UTC
From:
To:
I have a 100% reproducible crash of what I believe is the radeon
driver. Quite frequently, I've had my whole system hang and respond to
no actions. With this crash, I got a bit more info, as I could log
into the system using SSH after the screens flickered to their deaths
and the system otherwise became unresponsive.

All I have to do is use Iceweasel and load this URL:
http://www.youtube.com/watch?v=hVimVzgtD6w
(which contains a TED talk performed by Hans Rosling)
After a few seconds, the screens go black.

For my last try, I installed the debug symbols, but I don't know if
that has helped.

In the kern.log, I see thousands of lines that looks like this:

Mar  9 13:06:20 robin kernel: [  110.484512] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 504ms timeout going to reset GPU
Mar  9 13:06:20 robin kernel: [  110.484516] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:20 robin kernel: [  110.484518] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xE53024A4
Mar  9 13:06:20 robin kernel: [  110.484521] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00550002
Mar  9 13:06:20 robin kernel: [  110.484523] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:20 robin kernel: [  110.484532] radeon 0000:01:00.0:   R_008020_GRBM_SOFT_RESET=0x00007FEE
Mar  9 13:06:20 robin kernel: [  110.484584] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:20 robin kernel: [  110.484642] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:20 robin kernel: [  110.509372] hda-intel: IRQ timing workaround is activated for card #0. Suggest a bigger bdl_pos_adj.
Mar  9 13:06:20 robin kernel: [  110.509501] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:20 robin kernel: [  110.509504] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:20 robin kernel: [  110.509506] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:20 robin kernel: [  110.517679] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 504ms timeout going to reset GPU
Mar  9 13:06:20 robin kernel: [  110.517682] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:20 robin kernel: [  110.517685] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0x00003028
Mar  9 13:06:20 robin kernel: [  110.517687] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00000002
Mar  9 13:06:20 robin kernel: [  110.517690] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:20 robin kernel: [  110.517696] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:20 robin kernel: [  110.517753] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:20 robin kernel: [  110.542456] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:20 robin kernel: [  110.542457] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:20 robin kernel: [  110.542459] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.650016] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 572ms timeout going to reset GPU
Mar  9 13:06:21 robin kernel: [  110.650018] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:21 robin kernel: [  110.650020] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0x00003028
Mar  9 13:06:21 robin kernel: [  110.650022] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00000002
Mar  9 13:06:21 robin kernel: [  110.650023] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:21 robin kernel: [  110.650029] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:21 robin kernel: [  110.650085] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:21 robin kernel: [  110.674421] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.674423] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.674424] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.728782] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 704ms timeout going to reset GPU
Mar  9 13:06:21 robin kernel: [  110.728784] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:21 robin kernel: [  110.728786] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0x00003028
Mar  9 13:06:21 robin kernel: [  110.728788] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00000002
Mar  9 13:06:21 robin kernel: [  110.728790] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:21 robin kernel: [  110.728795] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:21 robin kernel: [  110.728851] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:21 robin kernel: [  110.753413] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.753415] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.753416] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.761630] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 780ms timeout going to reset GPU
Mar  9 13:06:21 robin kernel: [  110.761632] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:21 robin kernel: [  110.761633] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0x00003028
Mar  9 13:06:21 robin kernel: [  110.761635] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00000002
Mar  9 13:06:21 robin kernel: [  110.761637] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:21 robin kernel: [  110.761649] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:21 robin kernel: [  110.761705] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:21 robin kernel: [  110.786414] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.786415] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.786417] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  110.947985] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 972ms timeout
Mar  9 13:06:21 robin kernel: [  110.947987] [drm:radeon_fence_wait] *ERROR* last signaled fence(0x0000492F)
Mar  9 13:06:21 robin kernel: [  111.106672] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcfa40:0x0000492F) 1132ms timeout
Mar  9 13:06:21 robin kernel: [  111.106674] [drm:radeon_fence_wait] *ERROR* last signaled fence(0x0000492F)
Mar  9 13:06:21 robin kernel: [  111.112014] [drm:radeon_fence_wait] *ERROR* fence(ffff8800cdaeb600:0x00004930) 1132ms timeout going to reset GPU
Mar  9 13:06:21 robin kernel: [  111.112018] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:21 robin kernel: [  111.112020] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xA0003028
Mar  9 13:06:21 robin kernel: [  111.112023] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00000002
Mar  9 13:06:21 robin kernel: [  111.112025] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:21 robin kernel: [  111.112031] radeon 0000:01:00.0:   R_008020_GRBM_SOFT_RESET=0x00007FEE
Mar  9 13:06:21 robin kernel: [  111.112084] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:21 robin kernel: [  111.112141] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:21 robin kernel: [  111.136336] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  111.136338] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  111.136339] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  111.309159] [drm:radeon_fence_wait] *ERROR* fence(ffff8800cdaeb600:0x00004930) 1336ms timeout
Mar  9 13:06:21 robin kernel: [  111.309160] [drm:radeon_fence_wait] *ERROR* last signaled fence(0x00004930)
Mar  9 13:06:21 robin kernel: [  111.316511] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcf480:0x00004931) 1332ms timeout going to reset GPU
Mar  9 13:06:21 robin kernel: [  111.316514] radeon 0000:01:00.0: GPU softreset
Mar  9 13:06:21 robin kernel: [  111.316516] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xA0003028
Mar  9 13:06:21 robin kernel: [  111.316519] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0x00000002
Mar  9 13:06:21 robin kernel: [  111.316521] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0x200000C0
Mar  9 13:06:21 robin kernel: [  111.316527] radeon 0000:01:00.0:   R_008020_GRBM_SOFT_RESET=0x00007FEE
Mar  9 13:06:21 robin kernel: [  111.316580] radeon 0000:01:00.0: R_008020_GRBM_SOFT_RESET=0x00000001
Mar  9 13:06:21 robin kernel: [  111.316637] radeon 0000:01:00.0:   R_000E60_SRBM_SOFT_RESET=0x00000402
Mar  9 13:06:21 robin kernel: [  111.341308] radeon 0000:01:00.0:   R_008010_GRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  111.341310] radeon 0000:01:00.0:   R_008014_GRBM_STATUS2=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  111.341311] radeon 0000:01:00.0:   R_000E50_SRBM_STATUS=0xFFFFFFFF
Mar  9 13:06:21 robin kernel: [  111.504801] [drm:radeon_fence_wait] *ERROR* fence(ffff8800c9bcf480:0x00004931) 1528ms timeout
Mar  9 13:06:21 robin kernel: [  111.504803] [drm:radeon_fence_wait] *ERROR* last signaled fence(0x00004931)

I've seen people reporting similar things in Ubuntu-forums a year ago,
but apparently no solutions. I guess it might be an upstream problem,
but google gave no hits beyond Debian/Ubuntu, so it might also not be.

This is affecting the usefulness of my system in a major way, so I was
hoping there might be a fix...

#617498#12
Date:
2011-03-15 01:46:43 UTC
From:
To:
I am hitting this as well, and it's a 100% sure shot crash.  I haven't
tested ssh to the box as my laptop is currently broken.  Very rarely, if
I am fast enough at closing the Youtube tab, the system will recover
after a minute or so.

I've hit this on ALL Youtube videos, not just the one indicated.
Embedded files seem to play okay - it's something triggered by visiting
the youtube.com site in particular.  Other embedded video plays without
a problem.

I've tried this on 2.6.37 from experimental as well as 2.6.32 from wheezy.  No
difference.  I am running Xorg from experimental and have NOT tested
rolling back to wheezy packages.

While I occasionally get kernel errors similar to the original poster, I
more frequently get the following traceback:

Mar 14 19:08:17 vanvanmojo kernel: [90522.792100] radeon 0000:01:05.0: GPU lockup CP stall for more than 10020msec
Mar 14 19:08:17 vanvanmojo kernel: [90522.792109] ------------[ cut here ]------------
Mar 14 19:08:17 vanvanmojo kernel: [90522.792169] WARNING: at /build/buildd-linux-2.6_2.6.37-1~experimental.1-i386-rePuD0/linux-2.6-2.6.37/debian/build/source_i386_none/drivers/gpu/drm/radeon/radeon_fenc
Mar 14 19:08:17 vanvanmojo kernel: [90522.792179] Hardware name: TA785GE 128M
Mar 14 19:08:17 vanvanmojo kernel: [90522.792185] GPU lockup (waiting for 0x0097D6E4 last fence id 0x0097D6DF)
Mar 14 19:08:17 vanvanmojo kernel: [90522.792190] Modules linked in: powernow_k8 mperf cpufreq_stats cpufreq_userspace cpufreq_conservative cpufreq_powersave battery parport_pc ppdev lp parport sco bnep
Mar 14 19:08:17 vanvanmojo kernel: c_core evdev tpm_bios processor button snd soundcore snd_page_alloc wmi shpchp pci_hotplug ext4 mbcache jbd2 crc16 usbhid hid dm_mod btrfs zlib_deflate crc32c libcrc32c
Mar 14 19:08:17 vanvanmojo kernel: [90522.792368] Pid: 1745, comm: Xorg Not tainted 2.6.37-trunk-686 #1
Mar 14 19:08:17 vanvanmojo kernel: [90522.792374] Call Trace:
Mar 14 19:08:17 vanvanmojo kernel: [90522.792388]  [<c102f0c1>] ? warn_slowpath_common+0x6a/0x7b
Mar 14 19:08:17 vanvanmojo kernel: [90522.792427]  [<f8fee51d>] ? radeon_fence_wait+0x1e9/0x26f [radeon]
Mar 14 19:08:17 vanvanmojo kernel: [90522.792437]  [<c102f138>] ? warn_slowpath_fmt+0x28/0x2c
Mar 14 19:08:17 vanvanmojo kernel: [90522.792475]  [<f8fee51d>] ? radeon_fence_wait+0x1e9/0x26f [radeon]
Mar 14 19:08:17 vanvanmojo kernel: [90522.792491]  [<c10442e6>] ? autoremove_wake_function+0x0/0x29
Mar 14 19:08:17 vanvanmojo kernel: [90522.792509]  [<f8efb5a0>] ? ttm_bo_wait+0xaa/0x132 [ttm]
Mar 14 19:08:17 vanvanmojo kernel: [90522.792526]  [<f8efe180>] ? ttm_bo_vm_fault+0x98/0x1c7 [ttm]
Mar 14 19:08:17 vanvanmojo kernel: [90522.792561]  [<f8feea71>] ? radeon_ttm_fault+0x35/0x45 [radeon]
Mar 14 19:08:17 vanvanmojo kernel: [90522.792572]  [<c10a1c02>] ? __do_fault+0x44/0x379
Mar 14 19:08:17 vanvanmojo kernel: [90522.792580]  [<c1008e28>] ? restore_i387_fxsave+0x5c/0x6d
Mar 14 19:08:17 vanvanmojo kernel: [90522.792589]  [<c10a28fa>] ? handle_mm_fault+0x3a6/0x8da
Mar 14 19:08:17 vanvanmojo kernel: [90522.792599]  [<c128a0c7>] ? do_page_fault+0x353/0x36b
Mar 14 19:08:17 vanvanmojo kernel: [90522.792609]  [<c10b97c3>] ? fsnotify_access+0x49/0x50
Mar 14 19:08:17 vanvanmojo kernel: [90522.792618]  [<c10024c3>] ? restore_sigcontext+0xbe/0xd5
Mar 14 19:08:17 vanvanmojo kernel: [90522.792625]  [<c10027ba>] ? sys_sigreturn+0x9a/0xbc
Mar 14 19:08:17 vanvanmojo kernel: [90522.792633]  [<c1289d74>] ? do_page_fault+0x0/0x36b
Mar 14 19:08:17 vanvanmojo kernel: [90522.792640]  [<c1287dbf>] ?Mar 14 19:10:05 vanvanmojo kernel: klogd 1.5.0#6, log source = /proc/kmsg started.


Then I hit reset and try to remember to not start iceweasel without paying
attention... :)

Ross

#617498#17
Date:
2011-03-15 09:00:33 UTC
From:
To:
[...]
The version number above and the X log below don't seem to point at
experimental Xorg.  Which is it?

Cheers,
Julien

#617498#22
Date:
2011-03-22 00:43:27 UTC
From:
To:
Tonight I updated to the latest bits from experimental and ended up
with a broken X setup.  I removed my pin file and downgraded all X
related packages to wheezy.  The original issue reported in the bug is
gone.  I wonder if I somehow ended up with a mostly-working mix of
package versions.

If I have some time next weekend, I'll try upgrading and reproducing
the issue again.

Ross